SCT:70B訓練記憶體減172倍
Spectral Compact Training (SCT) 實現70B級LLaMA-3風格模型記憶體減172倍(1245 GB至7.24 GB)。在Steam Deck CPU上全訓練步驟僅6.28秒,梯度精確匹配密集方法。Apache 2.0開源程式碼發布。
Tag: #memory-efficiency7 results
Spectral Compact Training (SCT) 實現70B級LLaMA-3風格模型記憶體減172倍(1245 GB至7.24 GB)。在Steam Deck CPU上全訓練步驟僅6.28秒,梯度精確匹配密集方法。Apache 2.0開源程式碼發布。
Gefen 是一款全新的 AdamW 優化器替代方案,旨在顯著降低大型語言模型訓練過程中的記憶體開銷。它透過將記憶體使用量減少高達 8 倍,讓大規模訓練變得更易於執行。

Apple 提出隨機 KV 路由,實現 transformer 模型的自適應深度快取共享,降低高吞吐量服務的 KV 快取記憶體。該方法針對深度維度進行優化,與時間軸壓縮方法正交。先前研究顯示每層完整快取多餘。

Google 公布一項研究突破,可大幅降低 AI 開發的記憶體需求。此舉引發儲存晶片股續跌,SK 海力士與三星電子在首爾下跌至少 6%。美國美光科技、西部數據與閃迪在美股交易中下跌至少 5%。

社群實作展示 VibeVoice 1.5B 在 iPhone 本機運行,記憶體使用量約 2.2 GB,速度最高可達即時速度的 1.28 倍。模型已上傳至 audio.cpp 的 Hugging Face 儲存庫,xcframework 與程式碼分支預計在 audio.cpp 0.6 版發布後提供。

DeepSpeed 推出與 PyTorch 完全相容的 backward API,用於高效訓練多模態與多組件模型,包括非純量 backward 呼叫。它還引入低精度模型最佳化,提升訓練過程的記憶體效率。
Reddit 貼文吹噓 TurboQuant 是無損技術,讓本地 LLM 不再需要記憶體。發文者諷刺地呼籲賣掉所有記憶體硬體。目的是維持炒作敘事以壓低記憶體價格。