🦙較早收集於 9h

Q4 量化基準測試揭曉最佳量化檔

Q4 量化基準測試揭曉最佳量化檔
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#quantization#kld#perplexityqwen3.5-35b-a3bqwen3.5-35b-a3baessedaiubergarmunsloth

💡Qwen3.5-35B 數據驅動 Q4 量化選擇:省 VRAM 保品質(22字)

⚡ 30-Second TL;DR

有什麼變化

KLD 測量化從 BF16 基準的漂移;越低越好

為什麼重要

引導從業者選最佳量化,節省 VRAM 同時保留本地推理模型品質。

下一步行動

下載 AesSedai_Qwen3.5-35B-A3B-IQ4_XS 獲頂級效率量化檔。

誰應關注:Developers & AI Engineers

關鍵要點

  • KLD 測量化從 BF16 基準的漂移;越低越好
  • AesSedai Q4_K_M 以 Q8_0 保護注意力/專家獲 KLD 0.0102 最佳
  • Ubergarm Q4_0 勝出其他 2.5 倍幅度
  • MXFP4 後訓練表現差;IQ4_XS 效率第一

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • Qwen3.5-35B-A3B 採用混合架構,整合線性注意力機制與稀疏混合專家模型(MoE),支援 262,144 tokens 上下文長度,並具備視覺語言能力,可處理文字、圖像與影片輸入。[1][3][4]
  • 該模型在 Artificial Analysis Intelligence Index 得分 37,高於同尺寸開源模型中位數 14,且輸出速度達 169.4 tokens/秒,遠超中位數 90.1 tokens/秒。[2]
  • Qwen3.5 系列於 2026-02-24 由 Alibaba Qwen 團隊發布,包含 Qwen3.5-122B-A10B、Qwen3.5-35B-A3B 與 Qwen3.5-27B 等模型,強調強化學習與全球 201 種語言支援。[1][6]

🛠️ 技術深入

  • 總參數 35B,激活參數僅 3B,使用 Gated Delta Networks 結合稀疏 MoE(總 256 專家,路由 8 個 + 1 共享激活),實現高效推理。[3]
  • 支援原生視覺語言融合訓練,跨代超越 Qwen3 與 Qwen3-VL,在推理、編碼、代理與視覺理解基準表現優異。[3]
  • 具備「Enable Thinking」功能,透過鏈式思考(chain-of-thought)處理複雜問題,並支援工具使用與推理細節輸出。[2][3][5]

🔮 前景展望AI analysis grounded in cited sources

Qwen3.5-35B-A3B 將加速中小型 MoE 模型在生產環境部署
其 3B 激活參數超越前代 22B 模型,結合低延遲與低計算成本,適合代理工作流與全球多語言應用。[1][3]
量化技術如 AesSedai Q4 將成為開源 LLM 高效部署標準
Q4_K_M 在 KLD 測量中以保護關鍵張量獲最佳分數,證明後訓練優化可維持高性能於資源受限裝置。[原文章]

時間線

2026-02-24
Alibaba Qwen 團隊發布 Qwen3.5 系列,包括 Qwen3.5-35B-A3B 模型
2026-02-25
Qwen3.5-35B-A3B 模型加入 Writingmate.ai 平台
2026-02-27
Reddit r/LocalLLaMA 發布 Q4 量化基準測試,AesSedai Q4_K_M 表現最佳
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。