Qwen3.5-122B-A10B Q4 後量化表現差
💡警示:Qwen3.5-122B-A10B Q4 後量化程式碼效能懸崖
⚡ 30-Second TL;DR
有什麼變化
Q4+ 良好,但大量 CPU 卸載限速 vs 27B
為什麼重要
突顯 MoE 模型如 Qwen3.5-122B-A10B 量化懸崖,建議生產程式碼任務低 VRAM 謹慎。可能推使用者堅持 Q4 或較小模型。
下一步行動
程式碼工作流程中堅持 Qwen3.5-122B-A10B 的 Q4 量化。
關鍵要點
- •Q4+ 良好,但大量 CPU 卸載限速 vs 27B
- •Q3_K_M/UD_Q2_K_XL:快速全 VRAM 但「毀壞程式碼庫」
- •語法/工具呼叫正常但決策失敗
- •48GB VRAM 環境測試
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
- •Qwen3.5-122B-A10B 採用混合架構(Gated DeltaNet + MoE),具有 122B 總參數但僅 10B 活躍參數,於 2026 年 2 月 25 日發布,相比前代 Qwen3-235B-A22B 實現更優效率[4]
- •模型在工具使用基準(BFCL-V4)上得分 72.2,超越 GPT-5 mini 的 55.5 達 30%,特別適合自主 AI 代理和函數調用應用[2]
- •Q4 量化版本在 ~73GB-80GB VRAM 上驗證可運行,但低於 Q4 的量化級別(Q3_K_M、Q2)在決策推理任務中出現性能崩潰,儘管推理速度保持 128-155 tokens/s[1][4]
📊 競品分析▸ Show
| 特性 | Qwen3.5-122B-A10B | GPT-5 mini | Claude Sonnet 4.5 |
|---|---|---|---|
| 活躍參數 | 10B | 未公開 | 未公開 |
| 工具使用基準 (BFCL-V4) | 72.2 | 55.5 | 未公開 |
| 推理速度 (tokens/s) | 154.7 | 未公開 | 未公開 |
| 上下文長度 | 262k (可擴展至 1M) | 未公開 | 未公開 |
| 發布日期 | 2026-02-25 | 未公開 | 未公開 |
🛠️ 技術深入
• 架構:Transformer 型混合模型,整合線性注意力機制與稀疏 MoE(256 個專家,每 token 激活 8 個路由專家 + 1 個共享專家)[4][5] • 多模態支持:原生支持文本、圖像、視頻輸入;詞彙表大小 248,320[5] • 上下文窗口:原生 262,144 tokens,可通過 YaRN 縮放擴展至 1,010,000 tokens[5] • 量化性能差異:BF16 全精度在 8 個 GPU 上支持完整上下文;Q4_K_M 量化驗證在 73-80GB VRAM 運行;低於 Q4 的量化級別(Q3_K_M、Q2)在複雜推理任務中出現決策失敗[4] • 推理效率:相比 Claude Sonnet 4.6 快 6 倍,同時保持競爭力質量[2] • 基準表現:MMLU-Pro 86.1%、GPQA Diamond 85.7%、SWE-bench Verified 72.4%、IFBench 75.7%[3][4]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。