Search

Tag: #quantization201 results

Google TurboQuant 加速 AI 記憶 8 倍,成本降 50%

Google TurboQuant 加速 AI 記憶 8 倍,成本降 50%

Google Research 發布 TurboQuant,一套軟體演算法組合,平均壓縮 KV 快取記憶體 6 倍,並加速注意力 logits 計算 8 倍。此無需訓練的解決方案可將企業 AI 推論成本降低 50% 以上,且不損模型智慧。包含 PolarQuant 和 QJL 的開源演算法現已開放,提前於 ICLR 和 AISTATS 2026 會議。

VentureBeatMediaMar 25#kv-cache#quantization#llm-inference
NextMem:LLM 代理的潛在事實記憶

NextMem:LLM 代理的潛在事實記憶

NextMem 是用於 LLM 代理的潛在事實記憶框架,利用自回歸自編碼器實現高效記憶建構與精準重建。它採用兩階段訓練流程,包括自回歸重建對齊與漸進潛在替換,並加入量化以降低儲存開銷。實驗顯示其在檢索、穩健性與擴展性上表現優異;程式碼已在 GitHub 開源。

Page 8 of 21