
DeepSeek DualPath 智能體 LLM 推理加速 1.9 倍
DeepSeek 聯手清華、北大發表新論文,推出 DualPath 推理系統,針對智能體 LLM 優化 KV-Cache 載入。透過雙路徑載入解決 PD 分離架構下的儲存頻寬不均問題。離線場景吞吐量提升 1.87 倍,在線服務提升 1.96 倍。
Tag: #kv-cache63 results

DeepSeek 聯手清華、北大發表新論文,推出 DualPath 推理系統,針對智能體 LLM 優化 KV-Cache 載入。透過雙路徑載入解決 PD 分離架構下的儲存頻寬不均問題。離線場景吞吐量提升 1.87 倍,在線服務提升 1.96 倍。
大型 LLM 推理受 KV 快取記憶體需求限制。蘋果將驅逐問題重構為強化學習,依未來效用排序權杖,並推出 KVP 框架。此法避免如最近性等啟發式代理,降低額外運算負荷。

此架構透過 Curvine 將快取儲存延伸至共享分散式 NVMe 集區,為 Amazon SageMaker HyperPod 加入分層 KV 快取。多個副本可接近本機磁碟的速度重用快取資料,降低使用超大型 GPU 執行個體的需求。
實驗結合 entropy 選擇、OLS 重建、SVD 壓縮用於 KV 快取。低記憶體下錯誤低 3 倍,勝 Top-K 剪枝且避開尖峰。原型部落格徵求回饋。

Moonshot 的 Kimi 使用混合 Kimi Linear 模型縮小 KV 快取,实现跨資料中心預填充/解碼分離。在 20 倍擴展模型上達 1.54 倍輸送量和 64% 降低 P90 TTFT。經 PaaS 降低權杖成本。

Qwen 3.6 新增 preserve_thinking 旗標,可保留完整推理脈絡,解決先前模板的 KV 快取無效問題。此功能有利代理情境,減少權杖消耗並提升推理效率。可用簡單的兩個數字測試驗證是否啟用。
r/MachineLearning 分享 TriAttention 論文,為長上下文推理提供高效 KV 快取壓縮方法。針對 LLM 改進。連結完整論文與討論。
記憶體晶片市場因 TurboQuant(推理用 KV cache 壓縮論文)在 48 小時內蒸發數百億。此技術不影響訓練記憶體(如激活、梯度、優化器狀態),後者佔 HBM 需求大宗。機器學習社群立即看出市場過度恐慌,商用推理已用 4-8 位元精度。
llama.cpp 更新修復了 Gemma 4 的 KV 快取問題,消除了先前高達 PB 級的 VRAM 消耗。這讓本地推理不再受硬體限制。
模擬探討Qwen3.5模型使用1位元權重與TurboQuant KV快取,大幅降低記憶體使用。例如122B模型從156GB降至18GB。這可能改變開源大型模型部署。