🦙較早收集於 3h

Qwen 3.5 需要 bf16 KV 快取

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡修正 llama.cpp 中 Qwen 3.5 準確度下降:使用 bf16 KV 快取,非 f16

⚡ 30-Second TL;DR

有什麼變化

llama.cpp 預設 f16 KV 快取降低 Qwen 3.5 困惑度

為什麼重要

防止本地執行中的細微準確度損失,確保基準與官方實作一致。

下一步行動

在 llama.cpp 執行 Qwen 3.5 時加入 -ctk bf16 -ctv bf16 旗標。

誰應關注:Developers & AI Engineers

關鍵要點

  • llama.cpp 預設 f16 KV 快取降低 Qwen 3.5 困惑度
  • bf16 KV 快取符合官方 vLLM 並產生最佳 PPL (6.5497)
  • 在 Qwen3.5-35B-A3B-UD-Q5_K_XL.gguf 上使用 wikitext-2-raw 測試
  • 需要旗標:-ctk bf16 -ctv bf16 以確保準確性

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • Qwen3.5-35B-A3B 採用混合專家(MoE)架構,每次前向傳遞僅啟動 3B 參數,相比前代 Qwen3-235B-A22B 的 22B 活躍參數實現了更優的架構效率[2]
  • bf16 KV 快取精度問題源於 llama.cpp 與官方 vLLM 實現的數值精度差異,vLLM 預設正確使用 bf16 以維持模型訓練時的精度一致性[1][2]
  • Qwen3.5 系列在 2026 年 2 月 24 日發布的中型模型系列包含四個變體,其中 35B-A3B 在 8GB+ VRAM GPU 上可運行,支援 GGUF 量化部署[2]

🛠️ 技術深入

MoE 架構設計:Qwen3.5-35B-A3B 採用混合注意力(Hybrid Attention)與專家路由機制,每個 token 僅通過 3B 參數的專家子網路,啟動率為 8.6%[2]KV 快取精度:bf16(bfloat16)相比 f16(float16)在保留指數位元的同時犧牲尾數精度,對於長上下文推理中的累積誤差更具容錯性[1]量化支援:模型以 GGUF 格式發布,支援多種量化級別(如 Q5_K_XL),可在消費級 GPU 上部署[2]上下文窗口:Qwen3.5-35B-A3B 支援 262K token 上下文,而 Qwen3.5-Plus 託管版本提供 1M token 上下文[2][3]開源授權:所有中型模型系列採用 Apache 2.0 授權,無使用限制,支援微調與商業部署[2]

🔮 前景展望AI analysis grounded in cited sources

llama.cpp 等推理框架需更新精度預設
bf16 KV 快取成為 Qwen3.5 系列的標準配置,推理框架若未同步更新預設值將導致困惑度偏差,影響模型評估的準確性。
邊緣設備部署對精度配置的依賴性提高
隨著 MoE 模型在資源受限環境中的應用增加,KV 快取精度選擇將成為部署決策的關鍵因素,需要更細緻的文件與工具支援。

時間線

2026-02-24
Alibaba 發布 Qwen 3.5 中型模型系列,包含四個變體,Qwen3.5-35B-A3B 成為開源主力模型
2026-02
Qwen3.5-Plus 託管版本在 Alibaba Cloud Model Studio 上線,提供 1M token 上下文與內建工具支援
2026-02
Qwen3.5 系列模型在 GitHub、Hugging Face、ModelScope 等平台發布,採用 Apache 2.0 開源授權
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。