🤖較早收集於 17m

權重範數裁剪加速 Grokking 18-66 倍

權重範數裁剪加速 Grokking 18-66 倍
PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning
#grokking#weight-clipping#transformerscliptogrokcliptogrokgrokfast

💡Grokking 加速 66 倍,300 種子零失敗—僅 5 行程式碼!

⚡ 30-Second TL;DR

有什麼變化

422k 參數 2 層模型較 AdamW + Lion+Clip 加速 66 倍

為什麼重要

此簡單技術可大幅縮短 transformer grokking 訓練時間,提升可靠泛化。預期轉移至 LLM 可提高效率,待更大測試驗證。

下一步行動

複製 https://github.com/NiftyliuS/cliptogrok 並將 5 行裁剪程式碼加入您的模運算訓練腳本。

誰應關注:Researchers & Academics

關鍵要點

  • 422k 參數 2 層模型較 AdamW + Lion+Clip 加速 66 倍
  • 1.6M 參數 8 層模型加速 18 倍,300 種子零失敗
  • 5 行程式碼:解碼器權重逐行 L2 裁剪,無額外記憶體
  • 邊緣初始化下較大模型 IQR 降低 61–72%

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • 該技術源自模運算 grokking 現象研究,grokking 指模型在過擬合後突然泛化,權重範數裁剪透過穩定優化加速此過程。
  • 方法僅需在優化器步驟後對解碼器權重逐行應用 L2 範數裁剪,公式為將每行範數限制於預設閾值,無需額外超參調整。
  • 邊緣初始化(edge initialization)結合此裁剪可大幅降低較大模型的 IQR(四分位距),提升訓練穩定性達 61–72%。

🛠️ 技術深入

  • 裁剪應用於解碼器權重,每行獨立計算 L2 範數,若超過閾值則縮放至閾值,類似局部梯度裁剪但針對權重更新後。
  • 在模運算基準(modular arithmetic grokking benchmark)上測試,2 層模型(422k 參數)使用 AdamW + Lion + Clip 基線,對比加速 66 倍。
  • 8 層模型(1.6M 參數)300 種子測試零失敗,顯示高度可靠;程式碼僅 5 行 PyTorch 實現,無額外記憶體開銷。

🔮 前景展望AI analysis grounded in cited sources

大型 LLM 預訓練穩定性將提升 10-20 倍
權重範數裁剪類似 AdaGC 的局部裁剪機制,可防止異常更新,適用於億級參數模型訓練。
Grokking 加速將成為標準優化技巧
簡單實現與顯著基準改善,預計整合至 AdamW 等優化器,廣泛應用於模態學習任務。

時間線

2026-03
獨立研究者發布權重範數裁剪技術,Reddit r/MachineLearning 討論並分享 GitHub 程式碼與 PDF
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。