🔬
Gefen 優化器宣稱訓練記憶體佔用減少 8 倍
Gefen 是一款全新的 AdamW 優化器替代方案,旨在顯著降低大型語言模型訓練過程中的記憶體開銷。它透過將記憶體使用量減少高達 8 倍,讓大規模訓練變得更易於執行。
Tag: #optimizer6 results
Gefen 是一款全新的 AdamW 優化器替代方案,旨在顯著降低大型語言模型訓練過程中的記憶體開銷。它透過將記憶體使用量減少高達 8 倍,讓大規模訓練變得更易於執行。
DeepSpeed 已正式整合對 Muon 優化器的支援,這是一種在頂尖 AI 實驗室中備受關注的高效能優化演算法。此更新讓開發者能在成熟的 DeepSpeed 生態系統中運用 Muon 的優勢。
karpathy/autoresearch 的分支引入 Weber 電動力學優化器,透過物理啟發的速度與加速度調整學習率。新增 RTL-SDR 硬體熵種子、多供應商 AI 代理框架具工具支援,以及多 GPU 相容性。合併社群實驗將基準 val/bpb 從 0.9979 提升至 0.9697。
Rose 是全新無狀態 PyTorch 優化器,VRAM 極低(低於 8-bit AdamW),收斂快且泛化強,Apache 2.0 授權。MNIST 基準顯示準確率競爭力強,儘管訓練損失偶高但驗證損失低。適合 ML 訓練,記憶體開銷最小。
AdamWClip 是 AdamW 優化器的擴展,具備自適應梯度裁剪功能,無需手動設定閾值。它不需額外記憶體,且計算開銷極小。初步實驗顯示,它明顯優於標準 grad_norm 裁剪的 AdamW。
Muon 優化器在 LLM 訓練中迅速流行,但未見用於 Transformers 以外領域,如 ConvNets。儘管發表時創 Cifar-10 訓練速度紀錄,搜尋卻無結果。貼文推測是否不具擴展性或錯過論文。