🔥PyTorch Blog•較早收集於 15m
DeepSpeed 現已支援 Muon Optimizer
💡了解如何將高效能的 Muon 優化器整合至您的 DeepSpeed 訓練管線中。
⚡ 30-Second TL;DR
有什麼變化
DeepSpeed 新增對 Muon 優化器的原生支援。
為什麼重要
此整合讓研究人員與工程師能輕鬆地在大規模訓練工作流程中實驗 Muon 的優化能力。這可能降低在生產環境中採用更新、更高效訓練技術的門檻。
下一步行動
更新您的 DeepSpeed 安裝,並在目前的訓練工作負載上測試 Muon 優化器,以評估收斂速度的提升。
誰應關注:Developers & AI Engineers
關鍵要點
- •DeepSpeed 新增對 Muon 優化器的原生支援。
- •Muon 優化器目前正被 Moonshot AI 等頂尖 AI 實驗室廣泛採用。
- •此次整合旨在提升大規模模型的訓練效率。
🧠 深度解析
Web-grounded analysis with 20 cited sources.
🔑 增強重點摘要
- •Muon 優化器在計算最佳化訓練中,相較於 AdamW 實現了約兩倍的計算效率,這意味著以一半的計算成本達到相同的模型性能,或在相同預算下獲得更好的性能。
- •Muon 的核心創新在於利用矩陣正交化技術,確保權重更新在損失函數景觀中保持特定的幾何特性,這與 Adam 或 AdamW 逐元素梯度更新的方法不同。
- •Moonshot AI 的 Moonlight 模型(一個具有 3B/16B 參數的混合專家模型)使用 Muon 在 5.7 兆個 token 上進行訓練,證明了其在大規模語言模型訓練中的可擴展性和效率。
- •Muon 在處理大型批次訓練時表現出卓越的數據效率,這使得訓練更經濟,並在重尾數據分佈上提供更好的性能,這對於利基企業應用至關重要。
📊 競品分析▸ Show
| 特性/產品 | DeepSpeed | PyTorch FSDP | Megatron-LM | Horovod |
|---|---|---|---|---|
| 主要功能 | 大規模模型訓練優化庫,包含 ZeRO 記憶體優化、3D 並行化(數據、模型、管線) | PyTorch 原生功能,提供數據並行化與記憶體效率(類似 ZeRO) | 大型語言模型訓練框架,提供分散式訓練和模型並行化能力 | 分散式訓練框架,支援多 GPU/節點的訓練擴展 |
| 記憶體優化 | ZeRO (Zero Redundancy Optimizer) 支援兆級參數模型,可卸載至 CPU/NVMe | 提供類似 ZeRO 的記憶體分片功能 | 具備模型並行化,有助於記憶體管理 | 主要專注於通訊優化,記憶體優化需結合其他技術 |
| 並行化 | 數據並行、模型並行、管線並行、3D 並行 | 數據並行(Fully Sharded Data Parallel) | 模型並行、數據並行 | 數據並行 |
| 基準性能 | 聲稱吞吐量提升高達 6.2 倍,收斂速度加快 2.8 倍,通訊量減少 4.6 倍 | 針對 PyTorch 生態系統內的大模型訓練提供競爭性效率 | 專為超大型模型設計,在模型並行方面表現出色 | 跨多個框架提供高效的分散式訓練 |
| 定價 | 免費/開源 | 免費/開源 | 免費/開源 | 免費/開源 |
| Muon 優化器支援 | 已原生支援 | PyTorch 2.9 已原生支援 torch.optim.Muon | NVIDIA NeMo-RL 支援 Muon,並要求 Megatron 後端 | 無直接提及,但作為通用框架可能可整合 |
| 易用性 | 開箱即用,旨在簡化大規模分散式訓練 | PyTorch 生態系統內整合良好 | 需要較多配置和專業知識 | 易於使用,提供單一 API 跨多個框架 |
🛠️ 技術深入
- Muon 的核心機制是透過牛頓-舒爾茨迭代 (Newton-Schulz iterations) 對基於動量的更新進行矩陣正交化。
- 它主要用於優化神經網路中的二維參數(權重矩陣)和卷積濾波器(透過扁平化處理)。
- 為實現大規模訓練,Muon 需要解耦權重衰減 (decoupled weight decay) 並仔細調整每個參數的更新尺度。
- 通常採用混合方法:Muon 用於矩陣參數,而 AdamW 則用於非矩陣參數,例如嵌入層、偏差和最終分類層。
- 分散式 Muon 實作結合了 ZeRO-1 風格的優化,以實現最佳記憶體效率和減少通訊開銷。
- 相較於 AdamW,Muon 在計算效率上約提升兩倍,並節省 33% 的記憶體。
- 在某些測試中,其通訊效率被驗證為 AdamW 的 0.57 倍。
- 由於 RMS 匹配,Muon 可以直接重複使用為 AdamW 調優的學習率和權重衰減超參數。
🔮 前景展望AI analysis grounded in cited sources
Muon 的廣泛採用將顯著降低大型語言模型訓練的計算成本。
Muon 相較於 AdamW 展現的約兩倍計算效率,將直接減少 LLM 開發所需的 GPU 時間和雲端費用。
將 Muon 整合到 DeepSpeed 等框架中,將加速開發更大、更複雜的 AI 模型。
透過解決記憶體和效率瓶頸,Muon 結合 DeepSpeed 的分散式訓練能力,能更有效地訓練具有數兆參數的模型。
對二階和矩陣感知優化器的研究將會加劇,從而帶來超越 Adam 長達十年主導地位的進一步創新。
Muon 作為十年來第一個挑戰 Adam 的可靠繼任者,以及 NorMuon 和 AdaMuon 等變體的出現,預示著優化器研究的範式轉變。
⏳ 時間線
2020-02
Microsoft 宣布推出 DeepSpeed,旨在加速 PyTorch 訓練。
2020-05
DeepSpeed 首次發布。
2024-12
Muon 優化器(MomentUm Orthogonalized by Newton-Schulz)由 Keller Jordan 等人首次提出。
2025-02
論文《Muon is Scalable for LLM Training》發表,介紹了 Moonlight 模型。
2025-05
PyTorch 2.9 原生支援 Muon 優化器 (`torch.optim.Muon`)。
2026-05
DeepSpeed 正式整合對 Muon 優化器的支援。
📎 來源 (20)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: PyTorch Blog ↗