🦙較早收集於 73m

Qwen3.5 35B-A3B 取代雙模型代理設定

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#agentic-workflow#apple-silicon#model-quantizationqwen3.5-35b-a3bqwen3.5-35b-a3bllama.cppm1-maxnemotron-3-nano-30b

💡單一 35B 模型在 M1 Mac 上勝過雙模型設定,處理編碼+推理任務(24字)

⚡ 30-Second TL;DR

有什麼變化

在 Apple M1 Max 64GB 上取代 Nemotron-3-Nano-30B + Qwen3-Coder-30B 組合

為什麼重要

簡化本地代理工作流程,讓消費級硬體可用單一模型,減少平衡多模型的工程負擔。

下一步行動

下載 Qwen3.5-35B-A3B Q4_K_XL,並透過 llama.cpp server 測試代理 Excel 分析。

誰應關注:Developers & AI Engineers

關鍵要點

  • 在 Apple M1 Max 64GB 上取代 Nemotron-3-Nano-30B + Qwen3-Coder-30B 組合
  • 處理完整代理任務:Excel 分析、pandas 程式、視覺化、銷售策略
  • 27 tok/s 速度;即使無思考模式輸出品質更好
  • Q4_K_XL 19GB 量化適合 32-64GB 裝置

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • Qwen3.5-35B-A3B 採用混合專家(MoE)架構,每個token僅啟動約30億參數,同時保留35億參數模型的知識廣度,實現3B模型的速度與35B模型的能力[2]
  • 在Artificial Analysis Intelligence Index上,Qwen3.5-35B-A3B(推理版本)得分37分,遠高於同規模開源模型平均值15分,生成100M tokens時輸出冗長度遠超平均的12M[1]
  • Qwen3.5系列(包括Flash、27B密集模型、35B-A3B與122B-A10B MoE)驗證了「架構+數據+強化學習可超越純參數擴展」的設計理念,35B-A3B性能超越前代235B模型[3]
  • 在高端消費級GPU(如RTX 3090/4090)上,35B-A3B MoE模型實現60-100+ tokens/秒,相比27B密集模型的15-25 tokens/秒快5倍,但VRAM需求增加至20-22GB[2]
📊 競品分析▸ Show
特性Qwen3.5-27B(密集)Qwen3.5-35B-A3B(MoE)Qwen3.5-122B-A10B(MoE)
總參數27B35B122B
活躍參數27B~3B~10B
推理速度(RTX 3090)15-25 tok/s60-100+ tok/s更低(未公開)
VRAM需求(Q4)16-18GB20-22GB更高
最佳應用複雜編碼、角色扮演、邏輯推理快速聊天、代理、摘要高複雜度任務
Intelligence Index未公開37分未公開
VRAM效率更優較差最差

🛠️ 技術深入

MoE路由機制:35B-A3B使用路由系統,每個token僅啟動約3B參數(名稱中的「A3B」),保留35B模型的「記憶」但實現3B模型的「速度」[2]量化優化:Unsloth Dynamic IQ2_XXS量化版本在實際評估(LiveCodeBench v6、MMLU Pro)上超越AesSedai IQ3_S,儘管模型小11GB,證明困惑度與KL散度指標可能誤導[4]Imatrix加權量化:Imatrix技術有效改善低位元量化品質,特別是對ssm_out等敏感張量的2位元量化效果顯著[4]推理延遲:基於阿里巴巴API,首token時間(TTFT)為0.98秒,略高於同規模開源模型中位數0.53秒;輸出速度167.7 tokens/秒,遠高於中位數91.6 tok/s[1]上下文窗口:Qwen3.5-Flash預設1M上下文,支援SGLang部署框架[3]

🔮 前景展望AI analysis grounded in cited sources

MoE架構將成為本地推理的主流範式
35B-A3B在消費級硬體上實現5倍速度提升同時保持智能水平,預示著參數擴展時代向效率優先轉變。
單一模型代理設定將取代多模型組合
35B-A3B在推理、編碼、分析上的全能表現,使得先前需要Nano+Coder雙模型的設定成為過時配置。
量化與推理模式的動態切換將成為標準實踐
用戶報告禁用思考模式反而提升品質與速度的平衡,表明推理tokens的成本效益需重新評估。

時間線

2025-12
Qwen3.5系列模型發布,包括Flash、27B、35B-A3B與122B-A10B MoE版本
2026-01
Unsloth發布Qwen3.5-35B GGUF量化基準測試,驗證Dynamic IQ2_XXS量化方案優於競品
2026-02
社群報告35B-A3B在本地推理上成功取代雙模型代理設定,驗證MoE架構實用性
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。