🤖Reddit r/MachineLearning•較早收集於 17m
權重範數裁剪加速 Grokking 18-66 倍

#grokking#weight-clipping#transformerscliptogrokcliptogrokgrokfast
💡Grokking 加速 66 倍,300 種子零失敗—僅 5 行程式碼!
⚡ 30-Second TL;DR
有什麼變化
422k 參數 2 層模型較 AdamW + Lion+Clip 加速 66 倍
為什麼重要
此簡單技術可大幅縮短 transformer grokking 訓練時間,提升可靠泛化。預期轉移至 LLM 可提高效率,待更大測試驗證。
下一步行動
複製 https://github.com/NiftyliuS/cliptogrok 並將 5 行裁剪程式碼加入您的模運算訓練腳本。
誰應關注:Researchers & Academics
關鍵要點
- •422k 參數 2 層模型較 AdamW + Lion+Clip 加速 66 倍
- •1.6M 參數 8 層模型加速 18 倍,300 種子零失敗
- •5 行程式碼:解碼器權重逐行 L2 裁剪,無額外記憶體
- •邊緣初始化下較大模型 IQR 降低 61–72%
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
- •該技術源自模運算 grokking 現象研究,grokking 指模型在過擬合後突然泛化,權重範數裁剪透過穩定優化加速此過程。
- •方法僅需在優化器步驟後對解碼器權重逐行應用 L2 範數裁剪,公式為將每行範數限制於預設閾值,無需額外超參調整。
- •邊緣初始化(edge initialization)結合此裁剪可大幅降低較大模型的 IQR(四分位距),提升訓練穩定性達 61–72%。
🛠️ 技術深入
- •裁剪應用於解碼器權重,每行獨立計算 L2 範數,若超過閾值則縮放至閾值,類似局部梯度裁剪但針對權重更新後。
- •在模運算基準(modular arithmetic grokking benchmark)上測試,2 層模型(422k 參數)使用 AdamW + Lion + Clip 基線,對比加速 66 倍。
- •8 層模型(1.6M 參數)300 種子測試零失敗,顯示高度可靠;程式碼僅 5 行 PyTorch 實現,無額外記憶體開銷。
🔮 前景展望AI analysis grounded in cited sources
大型 LLM 預訓練穩定性將提升 10-20 倍
權重範數裁剪類似 AdaGC 的局部裁剪機制,可防止異常更新,適用於億級參數模型訓練。
Grokking 加速將成為標準優化技巧
簡單實現與顯著基準改善,預計整合至 AdamW 等優化器,廣泛應用於模態學習任務。
⏳ 時間線
2026-03
獨立研究者發布權重範數裁剪技術,Reddit r/MachineLearning 討論並分享 GitHub 程式碼與 PDF
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- arXiv — 2502
- csie.ntu.edu.tw — Iclr2026 Conference
- apxml.com — Gradient Clipping Techniques
- aws.amazon.com — Accelerating LLM Inference with Post Training Weight and Activation Using Awq and Gptq on Amazon Sagemaker AI
- articsledge.com — Model Weights
- developer.nvidia.com — Model Quantization Concepts Methods and Why It Matters
- frontiersin.org — Full
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週 AI 簡報
每週一封,可隨時退訂。