🦙較早收集於 33m

Qwen3.5-122B-A10B Q4 後量化表現差

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#quantization#moe#coding#vramqwen3.5-122b-a10bqwen3.5-122b-a10b

💡警示:Qwen3.5-122B-A10B Q4 後量化程式碼效能懸崖

⚡ 30-Second TL;DR

有什麼變化

Q4+ 良好,但大量 CPU 卸載限速 vs 27B

為什麼重要

突顯 MoE 模型如 Qwen3.5-122B-A10B 量化懸崖,建議生產程式碼任務低 VRAM 謹慎。可能推使用者堅持 Q4 或較小模型。

下一步行動

程式碼工作流程中堅持 Qwen3.5-122B-A10B 的 Q4 量化。

誰應關注:Developers & AI Engineers

關鍵要點

  • Q4+ 良好,但大量 CPU 卸載限速 vs 27B
  • Q3_K_M/UD_Q2_K_XL:快速全 VRAM 但「毀壞程式碼庫」
  • 語法/工具呼叫正常但決策失敗
  • 48GB VRAM 環境測試

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Qwen3.5-122B-A10B 採用混合架構(Gated DeltaNet + MoE),具有 122B 總參數但僅 10B 活躍參數,於 2026 年 2 月 25 日發布,相比前代 Qwen3-235B-A22B 實現更優效率[4]
  • 模型在工具使用基準(BFCL-V4)上得分 72.2,超越 GPT-5 mini 的 55.5 達 30%,特別適合自主 AI 代理和函數調用應用[2]
  • Q4 量化版本在 ~73GB-80GB VRAM 上驗證可運行,但低於 Q4 的量化級別(Q3_K_M、Q2)在決策推理任務中出現性能崩潰,儘管推理速度保持 128-155 tokens/s[1][4]
📊 競品分析▸ Show
特性Qwen3.5-122B-A10BGPT-5 miniClaude Sonnet 4.5
活躍參數10B未公開未公開
工具使用基準 (BFCL-V4)72.255.5未公開
推理速度 (tokens/s)154.7未公開未公開
上下文長度262k (可擴展至 1M)未公開未公開
發布日期2026-02-25未公開未公開

🛠️ 技術深入

架構:Transformer 型混合模型,整合線性注意力機制與稀疏 MoE(256 個專家,每 token 激活 8 個路由專家 + 1 個共享專家)[4][5]多模態支持:原生支持文本、圖像、視頻輸入;詞彙表大小 248,320[5]上下文窗口:原生 262,144 tokens,可通過 YaRN 縮放擴展至 1,010,000 tokens[5]量化性能差異:BF16 全精度在 8 個 GPU 上支持完整上下文;Q4_K_M 量化驗證在 73-80GB VRAM 運行;低於 Q4 的量化級別(Q3_K_M、Q2)在複雜推理任務中出現決策失敗[4]推理效率:相比 Claude Sonnet 4.6 快 6 倍,同時保持競爭力質量[2]基準表現:MMLU-Pro 86.1%、GPQA Diamond 85.7%、SWE-bench Verified 72.4%、IFBench 75.7%[3][4]

🔮 前景展望AI analysis grounded in cited sources

超過 100B 參數的開源模型量化需要嚴格的質量控制閾值
Qwen3.5-122B-A10B 在 Q4 以上表現良好但 Q3 及以下出現決策崩潰,表明大規模 MoE 模型的量化穩定性存在臨界點,未來量化工具需針對專家路由機制進行優化。
混合架構(線性注意力 + MoE)將成為 100B+ 級別開源模型的標準設計
Qwen3.5-122B-A10B 通過 Gated DeltaNet + MoE 實現 10B 活躍參數超越 22B 前代模型,證明架構創新優於參數規模擴展,預期競爭對手將採納類似設計。
本地部署的 VRAM 限制將推動 48GB 級別硬體成為企業 AI 代理的標準配置
Q4 量化需 73-80GB VRAM,但用戶在 48GB 環境測試報告性能退化,表明企業需升級至 80GB+ GPU 以確保生產環境穩定性。

時間線

2026-02
Qwen3.5-122B-A10B 發布(2026 年 2 月 25 日),採用混合 Gated DeltaNet + MoE 架構
2026-03
社群報告 Q3_K_M 與 UD_Q2_K_XL 量化版本在決策推理中出現性能崩潰,儘管推理速度保持高效
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。