
Google TurboQuant 加速 AI 推論
Google 的 TurboQuant 壓縮 LLM 推論中的 KV 快取及向量搜尋,在 Nvidia H100 上對 Gemma/Mistral 模型實現 6 倍記憶體節省及 8 倍加速。它解決關鍵瓶頸,提升硬體效率而不損準確度。分析師強調擴展潛力,但指出可能增加使用而非節省。
Tag: #kv-cache63 results

Google 的 TurboQuant 壓縮 LLM 推論中的 KV 快取及向量搜尋,在 Nvidia H100 上對 Gemma/Mistral 模型實現 6 倍記憶體節省及 8 倍加速。它解決關鍵瓶頸,提升硬體效率而不損準確度。分析師強調擴展潛力,但指出可能增加使用而非節省。

Google Research 發布 TurboQuant,一套軟體演算法組合,平均壓縮 KV 快取記憶體 6 倍,並加速注意力 logits 計算 8 倍。此無需訓練的解決方案可將企業 AI 推論成本降低 50% 以上,且不損模型智慧。包含 PolarQuant 和 QJL 的開源演算法現已開放,提前於 ICLR 和 AISTATS 2026 會議。
Delta-KV 量化 KV 快取差值而非絕對值,在 Llama 70B 上實現近無損 4-bit 壓縮,誤差減 10,000 倍。整合至 llama.cpp 分支,weight-skip 提升 10% 解碼速度。硬體無關、無需訓練。
AVP 讓代理傳遞 KV-cache 潛在狀態而非文字,現支援跨模型轉移,基準測試顯示程式碼生成準確度提升及 2-6 倍加速。提供免費 T4 的 Colab 筆記本,使用 HuggingFace Transformers 於 GPU 測試。基於 LatentMAS,下一步支援 vLLM。

Nvidia 研究人員推出 KV Cache Transform Coding (KVTC),無需修改模型即可將 LLM KV 快取記憶體減少高達 20 倍。它將首 token 生成時間加快 8 倍,降低多輪企業 AI 的 GPU 成本。解決長上下文對話與代理應用之關鍵瓶頸。

Nvidia 發表 BlueField-4 STX,參考架構新增 KV 快取情境記憶層,相較 CPU 儲存提供 5 倍 token 吞吐量及 4 倍能效。透過 DOCA 軟體供儲存夥伴使用,CMX 為首個機架實現。針對代理式 AI 成長情境需求。

NVIDIA 推出推理傳輸庫,提升大型語言模型在多 GPU 和節點上的分散式推理效能。它支援擴展至更多使用者同時降低延遲,使用如分散式服務、KV 快取載入及寬專家並行等技術。

韁具工程優化AI代理的工具、提示與上下文,提升效能,LangChain的GPT-5.2-Codex代理在Terminal Bench 2.0從52.8升至66.5。建基於上下文工程,包括KV快取、漸進披露、自我驗證與長時架構。

ContextCache 引入基於內容雜湊定址的持久 KV 快取,用於工具 schema,消除工具呼叫 LLM 中的重複預填充。於 50 個工具下實現 29 倍 TTFT 加速,延遲恆定且無品質損失。開源程式碼與論文均可取得。
社群要求的 Qwen3.5-35B-A3B 實驗證實 KV q8_0 量化提升吞吐量而不損品質。Q4_K_M 仍是最佳表現者,使用 --fit 達 74.7 tok/s。KL 散度顯示 UD-Q4_K_XL 表現明顯較差。