🔥較早收集於 15m

DeepSpeed 現已支援 Muon Optimizer

PostLinkedIn
🔥閱讀原文: PyTorch Blog

💡了解如何將高效能的 Muon 優化器整合至您的 DeepSpeed 訓練管線中。

⚡ 30-Second TL;DR

有什麼變化

DeepSpeed 新增對 Muon 優化器的原生支援。

為什麼重要

此整合讓研究人員與工程師能輕鬆地在大規模訓練工作流程中實驗 Muon 的優化能力。這可能降低在生產環境中採用更新、更高效訓練技術的門檻。

下一步行動

更新您的 DeepSpeed 安裝,並在目前的訓練工作負載上測試 Muon 優化器,以評估收斂速度的提升。

誰應關注:Developers & AI Engineers

關鍵要點

  • DeepSpeed 新增對 Muon 優化器的原生支援。
  • Muon 優化器目前正被 Moonshot AI 等頂尖 AI 實驗室廣泛採用。
  • 此次整合旨在提升大規模模型的訓練效率。

🧠 深度解析

Web-grounded analysis with 20 cited sources.

🔑 增強重點摘要

  • Muon 優化器在計算最佳化訓練中,相較於 AdamW 實現了約兩倍的計算效率,這意味著以一半的計算成本達到相同的模型性能,或在相同預算下獲得更好的性能。
  • Muon 的核心創新在於利用矩陣正交化技術,確保權重更新在損失函數景觀中保持特定的幾何特性,這與 Adam 或 AdamW 逐元素梯度更新的方法不同。
  • Moonshot AI 的 Moonlight 模型(一個具有 3B/16B 參數的混合專家模型)使用 Muon 在 5.7 兆個 token 上進行訓練,證明了其在大規模語言模型訓練中的可擴展性和效率。
  • Muon 在處理大型批次訓練時表現出卓越的數據效率,這使得訓練更經濟,並在重尾數據分佈上提供更好的性能,這對於利基企業應用至關重要。
📊 競品分析▸ Show
特性/產品DeepSpeedPyTorch FSDPMegatron-LMHorovod
主要功能大規模模型訓練優化庫,包含 ZeRO 記憶體優化、3D 並行化(數據、模型、管線)PyTorch 原生功能,提供數據並行化與記憶體效率(類似 ZeRO)大型語言模型訓練框架,提供分散式訓練和模型並行化能力分散式訓練框架,支援多 GPU/節點的訓練擴展
記憶體優化ZeRO (Zero Redundancy Optimizer) 支援兆級參數模型,可卸載至 CPU/NVMe提供類似 ZeRO 的記憶體分片功能具備模型並行化,有助於記憶體管理主要專注於通訊優化,記憶體優化需結合其他技術
並行化數據並行、模型並行、管線並行、3D 並行數據並行(Fully Sharded Data Parallel)模型並行、數據並行數據並行
基準性能聲稱吞吐量提升高達 6.2 倍,收斂速度加快 2.8 倍,通訊量減少 4.6 倍針對 PyTorch 生態系統內的大模型訓練提供競爭性效率專為超大型模型設計,在模型並行方面表現出色跨多個框架提供高效的分散式訓練
定價免費/開源免費/開源免費/開源免費/開源
Muon 優化器支援已原生支援PyTorch 2.9 已原生支援 torch.optim.MuonNVIDIA NeMo-RL 支援 Muon,並要求 Megatron 後端無直接提及,但作為通用框架可能可整合
易用性開箱即用,旨在簡化大規模分散式訓練PyTorch 生態系統內整合良好需要較多配置和專業知識易於使用,提供單一 API 跨多個框架

🛠️ 技術深入

  • Muon 的核心機制是透過牛頓-舒爾茨迭代 (Newton-Schulz iterations) 對基於動量的更新進行矩陣正交化。
  • 它主要用於優化神經網路中的二維參數(權重矩陣)和卷積濾波器(透過扁平化處理)。
  • 為實現大規模訓練,Muon 需要解耦權重衰減 (decoupled weight decay) 並仔細調整每個參數的更新尺度。
  • 通常採用混合方法:Muon 用於矩陣參數,而 AdamW 則用於非矩陣參數,例如嵌入層、偏差和最終分類層。
  • 分散式 Muon 實作結合了 ZeRO-1 風格的優化,以實現最佳記憶體效率和減少通訊開銷。
  • 相較於 AdamW,Muon 在計算效率上約提升兩倍,並節省 33% 的記憶體。
  • 在某些測試中,其通訊效率被驗證為 AdamW 的 0.57 倍。
  • 由於 RMS 匹配,Muon 可以直接重複使用為 AdamW 調優的學習率和權重衰減超參數。

🔮 前景展望AI analysis grounded in cited sources

Muon 的廣泛採用將顯著降低大型語言模型訓練的計算成本。
Muon 相較於 AdamW 展現的約兩倍計算效率,將直接減少 LLM 開發所需的 GPU 時間和雲端費用。
將 Muon 整合到 DeepSpeed 等框架中,將加速開發更大、更複雜的 AI 模型。
透過解決記憶體和效率瓶頸,Muon 結合 DeepSpeed 的分散式訓練能力,能更有效地訓練具有數兆參數的模型。
對二階和矩陣感知優化器的研究將會加劇,從而帶來超越 Adam 長達十年主導地位的進一步創新。
Muon 作為十年來第一個挑戰 Adam 的可靠繼任者,以及 NorMuon 和 AdaMuon 等變體的出現,預示著優化器研究的範式轉變。

時間線

2020-02
Microsoft 宣布推出 DeepSpeed,旨在加速 PyTorch 訓練。
2020-05
DeepSpeed 首次發布。
2024-12
Muon 優化器(MomentUm Orthogonalized by Newton-Schulz)由 Keller Jordan 等人首次提出。
2025-02
論文《Muon is Scalable for LLM Training》發表,介紹了 Moonlight 模型。
2025-05
PyTorch 2.9 原生支援 Muon 優化器 (`torch.optim.Muon`)。
2026-05
DeepSpeed 正式整合對 Muon 優化器的支援。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: PyTorch Blog