NVIDIA發明新技術KVTC 記憶體使用量縮減20倍
NVIDIA研究人員推出KVTC(KV快取轉換編碼),將大型語言模型對話歷史的記憶體用量最高縮減20倍,且無需修改模型本身。此技術解決長對話推理時的記憶體不足問題,大幅降低企業AI硬體成本,並將首次生成回應時間最高提速8倍。
Tag: #memory-optimization20 results
NVIDIA研究人員推出KVTC(KV快取轉換編碼),將大型語言模型對話歷史的記憶體用量最高縮減20倍,且無需修改模型本身。此技術解決長對話推理時的記憶體不足問題,大幅降低企業AI硬體成本,並將首次生成回應時間最高提速8倍。

本文探討了在 LLM 訓練期間克服 GPU 高頻寬記憶體 (HBM) 限制的策略。文中介紹了透過主機卸載 (host offloading) 技術來更有效地管理模型權重、梯度與優化器狀態。

這項研究提出將記憶體檢索移至代理的推理循環內,以消除網路延遲。透過使用進程內存儲,檢索時間從毫秒級降至微秒級,使代理能夠維持持久且高速的工作記憶。

Akashic 是一項新的 LLM 推論服務,利用 MemAttention 將數據組織成有界區塊,藉此優化長文本管理。它透過減少檢索碎片化並最小化 I/O 開銷來提高效率,無需重複重寫完整的互動歷史記錄。

Microsoft Research 推出了 Memora,這是一種將記憶儲存與檢索解耦的架構,旨在改善 AI 代理的長期上下文保留能力。該技術旨在減少高達 98% 的上下文 Token 使用量,同時保持 AI 代理的高準確度。

AMD 收購了專注於 AI 記憶體優化技術的公司 MEXT,旨在降低數據中心的總擁有成本 (TCO)。此舉旨在應對 Agentic AI 等新一代應用對記憶體需求的激增。
開發者修改 llama.cpp,在 Samsung Galaxy Watch 4(380MB RAM)上運行 SmolLM2-360M,將峰值 RAM 從 524MB 降至 142MB。主要修正使用 llama_model_params 中的 host_ptr,避免模型在 RAM 中雙重載入。提供程式碼儲存庫與詳細說明。
Google 的 TurboQuant AI 壓縮演算法將 LLM 記憶體使用減 6 倍而不損輸出品質。Ars Technica 文章強調效率提升。用於家用大型模型部署的希望。
TurboQuant 將演算法適應至 LLM 權重壓縮,提供 nn.Linear 即插即用替代方案,具近最佳 4 位元量化與無損 8 位元殘差。在 Qwen3.5-0.8B 上基準測試顯示 8 位元總計 PPL 零增加與 3.2 倍記憶體縮減。GitHub 提供完整文件、基準與 Triton 核心。

Google 推出 TurboQuant,一種將關鍵值 (KV) 快取記憶體需求降低六倍的 AI 演算法,這對提供 AI 模型至使用者至關重要。此消息導致三星及 SK 海力士等記憶體晶片股下跌。分析師認為這是投資者「逢低買入」的機會。