🤖Reddit r/MachineLearning•最新收集於 43m
為什麼 Adam 會失去 GD 的低秩偏置

💡受控優化器比較指出,Adam 的逐座標縮放可能是低秩恢復偏置消失的關鍵。
⚡ 30-Second TL;DR
有什麼變化
因子化模型 W = UV^T 對因子基底的旋轉保持不變,而標準 GD 會遵守這項對稱性。
為什麼重要
研究結果顯示,即使訓練損失相同,優化器選擇仍可能改變矩陣因子化與深度線性系統的歸納偏置。使用自適應優化器進行低秩學習時,實務人員應評估恢復品質與對基底的敏感度,而不只看訓練或驗證損失。
下一步行動
使用作者公開的矩陣感測程式碼,在你的低秩工作負載上比較 Adam 與 shared-scalar Adam,並搭配全域範數裁剪。
誰應關注:Researchers & Academics
關鍵要點
- •因子化模型 W = UV^T 對因子基底的旋轉保持不變,而標準 GD 會遵守這項對稱性。
- •Adam 的逐座標自適應分母會引入依賴基底的各向異性,似乎會損害隱含的低秩恢復能力。
- •從逐座標正規化逐步轉向共享純量正規化時,恢復效果單調改善,顯示各向異性可能是主要機制。
- •Muon 在真正低秩目標上可媲美 GD,但隨著頻譜尾部能量增加而快速退化,約在 4% 尾部能量時落後 GD。
- •將逐座標裁剪改為全域範數裁剪後,作者自有優化器的恢復誤差從 0.347 降至 0.220。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •研究指出 Adam 的逐座標(coordinate-wise)縮放會將優化路徑偏向與座標軸對齊的解,這與矩陣分解中隱含的旋轉不變性產生衝突。
- •該現象與「隱含偏置」(Implicit Bias)理論密切相關,即優化器在欠定系統中傾向於尋找具有特定結構(如低秩)的解,而非僅僅是最小化損失函數。
- •實驗顯示,使用共享純量(shared-scalar)的優化器(如 Adam-style 但不進行逐座標縮放)能有效恢復低秩結構,證實了各向異性縮放是導致偏置喪失的關鍵因素。
- •Muon 優化器雖然在低秩恢復上表現優異,但其本質上是一種基於動量與矩陣預處理的算法,在處理非低秩或高頻譜尾部能量的數據時,其預處理矩陣可能引入偏差。
- •這項發現對大語言模型(LLM)訓練具有啟示,因為許多現代模型架構依賴低秩適配(LoRA)或隱含的低秩結構,Adam 的選擇可能在無意中限制了模型對某些特徵的學習能力。
📊 競品分析▸ Show
| 優化器 | 縮放機制 | 低秩偏置保留 | 適用場景 |
|---|---|---|---|
| GD | 無 | 高 | 理論研究、簡單矩陣分解 |
| Adam | 逐座標 | 低 | 通用深度學習、LLM 預訓練 |
| Muon | 矩陣預處理 | 高 (低頻譜) | 大規模模型訓練、低秩目標 |
| Shampoo | 二階矩陣 | 高 | 高維度、複雜曲率優化 |
| Lion | 符號梯度 | 低 | 記憶體受限場景 |
🛠️ 技術深入
- 旋轉不變性(Rotational Invariance):在矩陣分解 W = UV^T 中,對於任何可逆矩陣 R,W = (UR)(V R^{-T})^T 保持不變,標準 GD 遵循此對稱性。
- 逐座標縮放(Coordinate-wise Scaling):Adam 通過維護每個參數的二階矩估計 v_t,導致更新步長在不同維度上具有各向異性,破壞了上述旋轉對稱性。
- 共享純量(Shared-scalar):將 Adam 的分母替換為所有參數的全局統計量,從而恢復各向同性,使優化器重新獲得低秩偏置。
- 頻譜尾部能量(Spectral Tail Energy):指矩陣奇異值分佈中非主要成分的能量佔比,Muon 在該指標超過 4% 時性能顯著下降,顯示其對低秩結構的強依賴性。
🔮 前景展望AI analysis grounded in cited sources
未來的大模型優化器將更傾向於採用混合縮放策略。
為了兼顧訓練穩定性與隱含的低秩偏置,研究者將開發結合逐座標縮放(用於穩定)與共享純量(用於保留結構)的混合優化算法。
低秩恢復能力將成為評估新優化器性能的標準指標。
由於該研究揭示了優化器對模型隱含結構的影響,未來優化器論文將必須證明其在欠定矩陣感測任務中的低秩恢復表現。
⏳ 時間線
2014-12
Adam 優化器首次發表,引入逐座標自適應學習率。
2023-02
Lion 優化器發表,進一步推廣了符號梯度與各向異性更新。
2024-10
Muon 優化器在訓練大型 Transformer 模型中展現出優於 Adam 的效率。
2025-06
學界開始深入探討自適應優化器對模型隱含偏置的負面影響。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗