Qwen 3.5 需要 bf16 KV 快取
💡修正 llama.cpp 中 Qwen 3.5 準確度下降:使用 bf16 KV 快取,非 f16
⚡ 30-Second TL;DR
有什麼變化
llama.cpp 預設 f16 KV 快取降低 Qwen 3.5 困惑度
為什麼重要
防止本地執行中的細微準確度損失,確保基準與官方實作一致。
下一步行動
在 llama.cpp 執行 Qwen 3.5 時加入 -ctk bf16 -ctv bf16 旗標。
關鍵要點
- •llama.cpp 預設 f16 KV 快取降低 Qwen 3.5 困惑度
- •bf16 KV 快取符合官方 vLLM 並產生最佳 PPL (6.5497)
- •在 Qwen3.5-35B-A3B-UD-Q5_K_XL.gguf 上使用 wikitext-2-raw 測試
- •需要旗標:-ctk bf16 -ctv bf16 以確保準確性
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 6 個來源。
🔑 增強重點摘要
🛠️ 技術深入
• MoE 架構設計:Qwen3.5-35B-A3B 採用混合注意力(Hybrid Attention)與專家路由機制,每個 token 僅通過 3B 參數的專家子網路,啟動率為 8.6%[2] • KV 快取精度:bf16(bfloat16)相比 f16(float16)在保留指數位元的同時犧牲尾數精度,對於長上下文推理中的累積誤差更具容錯性[1] • 量化支援:模型以 GGUF 格式發布,支援多種量化級別(如 Q5_K_XL),可在消費級 GPU 上部署[2] • 上下文窗口:Qwen3.5-35B-A3B 支援 262K token 上下文,而 Qwen3.5-Plus 託管版本提供 1M token 上下文[2][3] • 開源授權:所有中型模型系列採用 Apache 2.0 授權,無使用限制,支援微調與商業部署[2]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
📎 來源 (6)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。

