Search

Tag: #memory-compression5 results

Google TurboQuant 加速 AI 記憶 8 倍,成本降 50%

Google TurboQuant 加速 AI 記憶 8 倍,成本降 50%

Google Research 發布 TurboQuant,一套軟體演算法組合,平均壓縮 KV 快取記憶體 6 倍,並加速注意力 logits 計算 8 倍。此無需訓練的解決方案可將企業 AI 推論成本降低 50% 以上,且不損模型智慧。包含 PolarQuant 和 QJL 的開源演算法現已開放,提前於 ICLR 和 AISTATS 2026 會議。

VentureBeatMediaMar 25#kv-cache#quantization#llm-inference
SideQuest:模型驅動 KV 快取管理,用於長時程代理推理

SideQuest:模型驅動 KV 快取管理,用於長時程代理推理

SideQuest 利用大型推理模型 (LRM) 本身,透過推理上下文 token 的有用性來壓縮 KV 快取,適用於長上下文代理任務。它將壓縮視為平行輔助任務執行,避免汙染主要推理上下文。僅用 215 個樣本訓練的模型評估顯示,峰值 token 使用量減少 65%,準確度損失極小,優於啟發式方法。