🦙Reddit r/LocalLLaMA•較早收集於 75m
35B A3B MoE 比 9B 在本地更快
#local-inference#vram#moe#tokens-per-secondqwen-3.5-a3b-moeqwen-3.5a3b-moellama.cpp
💡真實速度:35B MoE 在 16GB VRAM 達 55t/s 勝慢速 9B
⚡ 30-Second TL;DR
有什麼變化
35B A3B MoE 在 16GB VRAM 與 64GB RAM 上穩定 49-55 token/s
為什麼重要
強調 MoE 模型在消費級硬體的實際本地運行速度,指引 LLM 推理硬體選擇。
下一步行動
使用 llama.cpp 在你的 16GB VRAM 上測試 Qwen 3.5 35B-A3B MoE。
誰應關注:Developers & AI Engineers
關鍵要點
- •35B A3B MoE 在 16GB VRAM 與 64GB RAM 上穩定 49-55 token/s
- •相同硬體上 9B 僅 23 t/s 較慢
- •使用者讚 35B MoE 適合本地推理極佳
- •9B 傳聞勝 120B OSS 儘管速度較慢
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
🛠️ 技術深入
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2026-02
Qwen3.5發布四款小中型模型,包括35B-A3B、122B-A10B、27B和9B,強調高性能開源。[3]
2026-03-02
Qwen3.5-9B和4B基準測試公布,視覺理解遠超gpt-oss-120B。[6]
2026-03-03
Reddit討論35B-A3B在16GB VRAM上49-55 t/s,優於9B的23 t/s。
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。