🤖Reddit r/MachineLearning•較早收集於 2h
Qwen3.5 MoE:突破還是漸進?
💡397B MoE 超低活躍參數:開源遊戲規則改變者?(18字)
⚡ 30-Second TL;DR
有什麼變化
MoE 架構總參數 397B,僅 17B 活躍
為什麼重要
若為突破,可實現巨型開源模型更高效訓練與推論,民主化高性能 AI。
下一步行動
下載並在你的 MoE 路由任務上基準測試 Qwen3.5-397B-A17B。
誰應關注:Researchers & Academics
關鍵要點
- •MoE 架構總參數 397B,僅 17B 活躍
- •質疑開源 LLM MoE 路由的新穎性
- •參考 Qwen3.5 官方發佈筆記進行分析
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 8 個來源。
🔑 增強重點摘要
- •Qwen3.5 採用混合注意力機制(Gated DeltaNet + Gated Attention),在75%的層中使用線性注意力,相比傳統Transformer架構實現了線性複雜度擴展,使其能在32K以上的上下文長度中保持顯著的吞吐量優勢[2][4]
- •Qwen3.5的MoE架構引入了共享專家(Shared Expert)機制,每個token同時經過一個密集MLP和Top-K路由到8個專家(共64個),這種設計在訓練穩定性和整體性能上優於標準稀疏架構[2]
- •397B-A17B模型在SWE-Bench Verified等代理編碼基準上與GLM-5和MiniMax M2.5相當,展示了MoE設計在實際應用中的競爭力,特別是在終端編碼和多步工作流執行場景[5]
- •Qwen3.5系列包含多個規模的模型(35B-A3B、122B-A10B、27B密集版),提供了從邊緣部署到高性能推理的靈活選擇,單個AMD Instinct GPU或節點即可部署完整規模模型[2]
- •官方發佈於2026年2月16日,首個版本為397B-A17B MoE模型,後續將發佈更多規模版本,標誌著Alibaba Qwen團隊從純參數規模擴展轉向架構效率和數據質量優先的策略轉變[1][8]
📊 競品分析▸ Show
| 特性 | Qwen3.5 397B-A17B | GLM-5 | MiniMax M2.5 |
|---|---|---|---|
| 架構 | MoE + Gated DeltaNet混合注意力 | 未詳細披露 | 未詳細披露 |
| 活躍參數 | 17B / 397B總參數 | 未公開 | 未公開 |
| 原生上下文長度 | 1M(262K原生) | 未詳細披露 | 未詳細披露 |
| SWE-Bench Verified | 相當水平 | 相當水平 | 相當水平 |
| 多模態能力 | 原生視覺代理 | 未詳細披露 | 未詳細披露 |
| 開源狀態 | 開源 | 開源 | 開源 |
🛠️ 技術深入
混合注意力架構
- Gated Delta Networks(線性注意力)佔75%的層,實現O(n)複雜度而非標準Transformer的O(n²)
- 剩餘25%為標準Gated Attention塊,保留必要的表達能力
- KV快取大幅縮小,即使在長上下文中也保持低記憶體占用[4]
MoE設計細節
- 共享專家路徑:密集MLP處理每個token,捕捉通用特徵,提升訓練穩定性
- 路由專家路徑:Top-K路由器將token同時分配到8個專家(共64個可用專家)[2]
- 優化實現:共享專家使用hipBLASLt GEMM核心,路由專家使用AITER FusedMoE實現
推理性能特性
- 在32K+token上下文中相比前代模型吞吐量顯著提升
- 397B-A17B模型在單個GPU或單節點上可部署完整規模,最大化ROI[2]
- 原生多模態:DeepStack和3D卷積支持視覺代理功能,可識別複雜環境中的物體[2]
上下文擴展
- 原生支持262K token上下文長度(相比235B-A22B的32K原生支持)
- 通過線性複雜度注意力機制實現,無需複雜的RAG分塊策略[5]
🔮 前景展望AI analysis grounded in cited sources
MoE架構將成為開源LLM的主流設計範式
Qwen3.5將混合注意力機制從實驗性的Qwen3-Next模型整合到主線產品中,表明業界已驗證該架構的生產可行性,預期其他開源團隊將採納類似設計。
邊緣和中端硬體上的高性能推理將成為競爭焦點
Qwen3.5系列提供30B-35B規模的高效模型,單GPU部署完整功能,將推動企業從雲端推理轉向本地部署,改變LLM的成本經濟學。
原生多模態代理能力將驅動新一代應用開發
Qwen3.5的視覺代理和原生工具使用能力減少了提示工程需求,使開發者能更快構建複雜的多步工作流應用,加速代理AI的商業化。
⏳ 時間線
2025-02
Qwen3-Coder-Next 80B模型發佈,展示MoE + Gated DeltaNet混合架構的可行性
2026-02-16
Qwen3.5系列正式發佈,首個版本為397B-A17B MoE模型
2026-02-24
Qwen3.5 Medium模型系列發佈,包含35B-A3B、122B-A10B、27B密集版本
2026-02-24
AMD Instinct GPU對Qwen3.5提供Day 0支持,優化MoE和視覺核心實現
📎 來源 (8)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- marktechpost.com — Alibaba Qwen Team Releases Qwen 3 5 Medium Model Series a Production Powerhouse Proving That Smaller AI Models Are Smarter
- amd.com — Day 0 Support for Qwen 3 5 on Amd Instinct Gpus
- siliconflow.com — The Best Qwen3 Models in 2025
- kaitchup.substack.com — Qwen35 Medium Models Dense vs Moe
- magazine.sebastianraschka.com — A Dream of Spring for Open Weight
- developer.nvidia.com — Develop Native Multimodal Agents with Qwen3 5 Vlm Using Nvidia GPU Accelerated Endpoints
- qwen.ai — Blog
- GitHub — Qwen3
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週 AI 簡報
每週一封,可隨時退訂。