🦙較早收集於 47m

120B MoE 模型系列是否正在沒落?

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#market-trends#moe#model-architecture120b-moe-modelsmistralqwendeepseek

💡了解 LLM 規模的轉變趨勢,以更好地規劃您 2026 年的模型架構策略。

⚡ 30-Second TL;DR

有什麼變化

近期發布傾向於 25B-35B 或 200B+ 規模

為什麼重要

依賴中型 MoE 模型以適應特定硬體限制的從業者,可能需要重新評估其未來專案的模型選擇策略。

下一步行動

將較小的 35B 模型與您目前的 120B MoE 部署進行基準測試,以確認它們是否符合您的效能需求。

誰應關注:Researchers & Academics

關鍵要點

  • 近期發布傾向於 25B-35B 或 200B+ 規模
  • 120B MoE 模型已超過三個月未更新
  • 市場正從中型 MoE 架構轉移

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 26 個來源。

🔑 增強重點摘要

  • OpenAI於2025年12月發布了開源的gpt-oss-120b MoE模型,其總參數為1170億,每個token激活51億參數,並能在單一80GB GPU上高效運行,這直接反駁了120B MoE模型近期缺乏更新的說法。
  • MoE架構的興起是為了在不按比例增加計算成本的情況下,顯著擴展模型容量,並透過稀疏激活特性實現計算效率,使其成為超大型模型(如DeepSeek-V3 671B MoE和Grok-1 314B MoE)的主流選擇。
  • 業界正積極開發MoE模型優化技術,例如字節跳動的COMET和DeepSeek的DualPipe,旨在解決MoE在分布式訓練中的高通信開銷和複雜性,顯著降低訓練成本並提高效率。
  • 小型語言模型(SLM),例如Mixtral 8x7B(實際激活參數約12B-13B),因其在特定任務上的高效率、低延遲和成本效益,正成為邊緣設備部署和專業化應用場景的優選,與超大型通用模型形成兩極化發展。

🛠️ 技術深入

  • MoE核心架構: MoE模型由一個門控網絡(或稱路由器)和多個「專家」網絡組成。門控網絡根據輸入token動態選擇一個或少數幾個專家進行處理,而非激活所有參數。
  • 稀疏激活: MoE模型的主要優勢在於其稀疏激活特性。儘管總參數量龐大,但在推理時每個輸入只激活一小部分專家(及相關參數),從而顯著降低了計算成本和記憶體需求,提升了計算效率。
  • Mixtral 8x7B: 這是一個著名的開源MoE模型,由8個7B參數的專家組成。每個token僅激活其中2個專家,使其有效激活參數約為12B-13B。其推理速度與12B-13B的密集模型相當,但在多項基準測試中表現優於LLaMA2-70B和GPT-3.5。總參數量約為47B。
  • 訓練挑戰: MoE模型在訓練過程中可能面臨穩定性問題,尤其是在小規模數據集上容易過擬合。此外,在分布式訓練環境中,專家路由機制會增加跨設備通信開銷,這是一個關鍵瓶頸。
  • 優化技術: 為解決MoE的通信瓶頸,業界開發了多種優化方案。例如,字節跳動的COMET技術通過細粒度計算-通信重疊,可將MoE訓練效率提升1.7倍,成本節省40%。DeepSeek的DualPipe也是針對MoE通信開銷的優化方案。
  • OpenAI gpt-oss-120b: 該模型總參數為1170億,每個token激活51億參數。它採用交替的密集和局部帶狀稀疏注意力模式,並能高效地在單一80GB GPU上運行。

🔮 前景展望AI analysis grounded in cited sources

MoE架構將成為超大型語言模型的主流設計範式。
MoE通過稀疏激活有效管理計算成本,同時允許模型容量大幅擴展,是實現兆級參數模型的關鍵。
小型語言模型(SLM)將在特定應用和邊緣設備部署中佔據主導地位。
SLM在效率、低延遲和成本效益方面具有優勢,特別適用於專業化或資源受限的任務。
模型優化技術將持續聚焦於降低MoE模型的訓練和推理成本。
MoE模型固有的通信開銷和訓練複雜性促使業界開發如COMET和DualPipe等技術,以提高其大規模部署的可行性。

時間線

1991-XX
Jacobs等人首次提出混合專家模型(MoE)的概念。
2017-XX
Transformer架構被提出,為後續大型語言模型(LLM)的發展奠定基礎。
2020-XX
Google的GShard項目首次將MoE技術引入Transformer架構,推動MoE在大規模訓練中的應用。
2021-XX
Google的Switch Transformer和GLaM模型進一步探索MoE在自然語言處理中的應用潛力。
2023-12
Mistral AI發布Mixtral 8x7B,一個開源MoE模型,其性能與LLaMA2-70B和GPT-3.5相當或更優。
2025-12
OpenAI發布開源MoE模型gpt-oss-120b和gpt-oss-20b,其中gpt-oss-120b總參數為1170億。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。