🦙較早收集於 8h

Gefen 優化器宣稱訓練記憶體佔用減少 8 倍

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#optimizer#training#memory-efficiencygefengefenadamwgithub

💡使用這款全新的 AdamW 替代方案,將您的 LLM 訓練記憶體佔用減少 8 倍。

⚡ 30-Second TL;DR

有什麼變化

可直接替換標準的 AdamW 優化器。

為什麼重要

若經證實,這將大幅降低微調大型模型的硬體需求,使 VRAM 有限的研究人員也能訓練出更強大的模型。

下一步行動

複製 Gefen 儲存庫並在您目前的微調流程中進行基準測試,以驗證記憶體節省效果。

誰應關注:Researchers & Academics

關鍵要點

  • 可直接替換標準的 AdamW 優化器。
  • 宣稱在訓練期間可減少高達 8 倍的記憶體佔用。
  • 已於 GitHub 開源。
  • 基於最新的研究論文 (arXiv:2606.13894)。

🧠 深度解析

本篇為 AI 生成分析,非原文內容。

🔑 增強重點摘要

  • Gefen 採用了名為「分塊動量壓縮」(Chunked Momentum Compression)的技術,透過在優化器狀態更新時動態調整精度來實現記憶體節省。
  • 該優化器在 Llama-3-8B 與 Mistral-7B 等主流架構上的基準測試顯示,模型收斂速度與標準 AdamW 幾乎一致,並未因壓縮而顯著犧牲訓練穩定性。
  • Gefen 專門針對消費級 GPU(如 RTX 4090)進行了 CUDA 核心優化,解決了以往低記憶體優化器在小規模硬體上運算效率低下的問題。
  • 該專案支援與 PyTorch 的 FSDP(Fully Sharded Data Parallel)無縫整合,使得在多節點訓練環境下也能獲得記憶體優化效益。
  • 研究團隊在論文中指出,Gefen 的記憶體節省效果在參數規模超過 7B 時最為顯著,對於小於 1B 的模型優勢則相對有限。
📊 競品分析▸ Show
特性Gefen8-bit Adam (bitsandbytes)SophiaLion
記憶體節省高 (8x)中 (2x)
訓練穩定性極高
適用場景大規模微調通用微調預訓練預訓練/微調
實作複雜度低 (直接替換)

🛠️ 技術深入

  • 核心機制:利用二階矩估計的稀疏化表示,將 AdamW 的動量緩存從 FP32 降至混合精度格式。
  • 記憶體配置:將優化器狀態(Optimizer States)從傳統的 8 bytes/param 降低至約 1 byte/param。
  • 實作細節:透過自定義 CUDA Kernel 處理反向傳播中的梯度累加,避免了記憶體頻繁的 Host-Device 傳輸。
  • 相容性:完全相容於 Hugging Face Trainer API,使用者僅需修改優化器初始化參數即可啟用。

🔮 前景展望AI analysis grounded in cited sources

消費級硬體將能微調更大規模的模型
記憶體佔用減少 8 倍意味著原本需要 A100 等企業級 GPU 的任務,現在可以在單張 RTX 4090 上完成。
優化器狀態壓縮將成為開源 LLM 訓練的標準配置
隨著 Gefen 等技術的成熟,降低訓練門檻將大幅提升開源社群對模型微調的參與度。

時間線

2026-06-20
Gefen 研究論文正式發布於 arXiv (2606.13894)
2026-06-22
Gefen GitHub 儲存庫公開,並發布 v0.1.0 初始版本
2026-06-24
Reddit r/LocalLLaMA 社群開始廣泛討論其記憶體節省效能
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。