🦙較早收集於 75m

35B A3B MoE 比 9B 在本地更快

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#local-inference#vram#moe#tokens-per-secondqwen-3.5-a3b-moeqwen-3.5a3b-moellama.cpp

💡真實速度:35B MoE 在 16GB VRAM 達 55t/s 勝慢速 9B

⚡ 30-Second TL;DR

有什麼變化

35B A3B MoE 在 16GB VRAM 與 64GB RAM 上穩定 49-55 token/s

為什麼重要

強調 MoE 模型在消費級硬體的實際本地運行速度,指引 LLM 推理硬體選擇。

下一步行動

使用 llama.cpp 在你的 16GB VRAM 上測試 Qwen 3.5 35B-A3B MoE。

誰應關注:Developers & AI Engineers

關鍵要點

  • 35B A3B MoE 在 16GB VRAM 與 64GB RAM 上穩定 49-55 token/s
  • 相同硬體上 9B 僅 23 t/s 較慢
  • 使用者讚 35B MoE 適合本地推理極佳
  • 9B 傳聞勝 120B OSS 儘管速度較慢

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Qwen3.5-35B-A3B採用MoE架構,總參數35B但每token僅激活約3B參數,提供類似3B模型的速度但保留35B記憶體優勢。[1]
  • Qwen3.5-9B稠密模型在視覺任務如MMMU-Pro(70.1)、MathVision(78.9)和OmniDocBench(87.7)超越GPT-5-Nano,並僅落後Qwen3.5-27B 4-8分。[2]
  • Qwen3.5系列小模型如9B在GPQA、IFEval和長上下文基準超越Qwen3-30B(3倍大小),並具備原生多模態能力提升視覺理解。[3]
📊 競品分析▸ Show
模型架構活躍參數速度優勢基準強項
Qwen3.5-35B-A3BMoE3B5x高於27B稠密代理工作流、即時聊天 [1]
Qwen3.5-27B稠密27B較慢編碼邏輯、角色扮演 [1]
Qwen3.5-9B稠密 (Gated DeltaNet)9B高於MoE每token成本但視覺領先視覺任務勝GPT-5-Nano [2]

🛠️ 技術深入

  • Qwen3.5-35B-A3B為Mixture-of-Experts (MoE)模型,使用路由系統每token激活約3B參數,總35B參數,提供高吞吐量適合本地推理。[1]
  • Qwen3.5-9B採用Gated DeltaNet混合注意力,支持262K至1M上下文窗口,常數記憶體使用,需相容推理框架以達最佳速度。[2]
  • 系列模型支援256K上下文、201語言、多模態混合推理,包括思考/非思考模式,35B和27B可在22GB RAM Mac上運行。[5]

🔮 前景展望AI analysis grounded in cited sources

MoE模型將主導本地部署
35B-A3B以3B活躍參數實現高速度,適合資源受限設備,推动高效推理普及。[1]
小模型視覺能力追平大模型
Qwen3.5-9B在多視覺基準超越GPT-5-Nano,顯示參數效率提升使輕量模型適用代理和多模態任務。[2]
Qwen3.5系列加速開源競爭
9B勝3倍大小Qwen3-30B,多款小模型開放原始碼,提升本地LLM在編碼和視覺的成本效益。[3]

時間線

2026-02
Qwen3.5發布四款小中型模型,包括35B-A3B、122B-A10B、27B和9B,強調高性能開源。[3]
2026-03-02
Qwen3.5-9B和4B基準測試公布,視覺理解遠超gpt-oss-120B。[6]
2026-03-03
Reddit討論35B-A3B在16GB VRAM上49-55 t/s,優於9B的23 t/s。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。