🤖較早收集於 2h

Qwen3.5 MoE:突破還是漸進?

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning
#open-source#routing#mixture-of-expertsqwen3.5qwen3.5moe

💡397B MoE 超低活躍參數:開源遊戲規則改變者?(18字)

⚡ 30-Second TL;DR

有什麼變化

MoE 架構總參數 397B,僅 17B 活躍

為什麼重要

若為突破,可實現巨型開源模型更高效訓練與推論,民主化高性能 AI。

下一步行動

下載並在你的 MoE 路由任務上基準測試 Qwen3.5-397B-A17B。

誰應關注:Researchers & Academics

關鍵要點

  • MoE 架構總參數 397B,僅 17B 活躍
  • 質疑開源 LLM MoE 路由的新穎性
  • 參考 Qwen3.5 官方發佈筆記進行分析

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • Qwen3.5 採用混合注意力機制(Gated DeltaNet + Gated Attention),在75%的層中使用線性注意力,相比傳統Transformer架構實現了線性複雜度擴展,使其能在32K以上的上下文長度中保持顯著的吞吐量優勢[2][4]
  • Qwen3.5的MoE架構引入了共享專家(Shared Expert)機制,每個token同時經過一個密集MLP和Top-K路由到8個專家(共64個),這種設計在訓練穩定性和整體性能上優於標準稀疏架構[2]
  • 397B-A17B模型在SWE-Bench Verified等代理編碼基準上與GLM-5和MiniMax M2.5相當,展示了MoE設計在實際應用中的競爭力,特別是在終端編碼和多步工作流執行場景[5]
  • Qwen3.5系列包含多個規模的模型(35B-A3B、122B-A10B、27B密集版),提供了從邊緣部署到高性能推理的靈活選擇,單個AMD Instinct GPU或節點即可部署完整規模模型[2]
  • 官方發佈於2026年2月16日,首個版本為397B-A17B MoE模型,後續將發佈更多規模版本,標誌著Alibaba Qwen團隊從純參數規模擴展轉向架構效率和數據質量優先的策略轉變[1][8]
📊 競品分析▸ Show
特性Qwen3.5 397B-A17BGLM-5MiniMax M2.5
架構MoE + Gated DeltaNet混合注意力未詳細披露未詳細披露
活躍參數17B / 397B總參數未公開未公開
原生上下文長度1M(262K原生)未詳細披露未詳細披露
SWE-Bench Verified相當水平相當水平相當水平
多模態能力原生視覺代理未詳細披露未詳細披露
開源狀態開源開源開源

🛠️ 技術深入

混合注意力架構

  • Gated Delta Networks(線性注意力)佔75%的層,實現O(n)複雜度而非標準Transformer的O(n²)
  • 剩餘25%為標準Gated Attention塊,保留必要的表達能力
  • KV快取大幅縮小,即使在長上下文中也保持低記憶體占用[4]

MoE設計細節

  • 共享專家路徑:密集MLP處理每個token,捕捉通用特徵,提升訓練穩定性
  • 路由專家路徑:Top-K路由器將token同時分配到8個專家(共64個可用專家)[2]
  • 優化實現:共享專家使用hipBLASLt GEMM核心,路由專家使用AITER FusedMoE實現

推理性能特性

  • 在32K+token上下文中相比前代模型吞吐量顯著提升
  • 397B-A17B模型在單個GPU或單節點上可部署完整規模,最大化ROI[2]
  • 原生多模態:DeepStack和3D卷積支持視覺代理功能,可識別複雜環境中的物體[2]

上下文擴展

  • 原生支持262K token上下文長度(相比235B-A22B的32K原生支持)
  • 通過線性複雜度注意力機制實現,無需複雜的RAG分塊策略[5]

🔮 前景展望AI analysis grounded in cited sources

MoE架構將成為開源LLM的主流設計範式
Qwen3.5將混合注意力機制從實驗性的Qwen3-Next模型整合到主線產品中,表明業界已驗證該架構的生產可行性,預期其他開源團隊將採納類似設計。
邊緣和中端硬體上的高性能推理將成為競爭焦點
Qwen3.5系列提供30B-35B規模的高效模型,單GPU部署完整功能,將推動企業從雲端推理轉向本地部署,改變LLM的成本經濟學。
原生多模態代理能力將驅動新一代應用開發
Qwen3.5的視覺代理和原生工具使用能力減少了提示工程需求,使開發者能更快構建複雜的多步工作流應用,加速代理AI的商業化。

時間線

2025-02
Qwen3-Coder-Next 80B模型發佈,展示MoE + Gated DeltaNet混合架構的可行性
2026-02-16
Qwen3.5系列正式發佈,首個版本為397B-A17B MoE模型
2026-02-24
Qwen3.5 Medium模型系列發佈,包含35B-A3B、122B-A10B、27B密集版本
2026-02-24
AMD Instinct GPU對Qwen3.5提供Day 0支持,優化MoE和視覺核心實現
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。