
谷歌 TurboQuant 論文遭 RaBitQ 嚴重質疑
谷歌推出 TurboQuant 極端壓縮演算法,聲稱可將 AI 記憶體占用降至 1/6、推理速度提升 8 倍,解決大模型 KV Cache 瓶頸。蘇黎世聯邦理工學院中國博士後高健揚指控該論文嚴重誤傳其 RaBitQ 工作,包括未承認關鍵相似性、無證據稱其理論次優,以及不公平實驗設定——這些問題投稿前已提但未修正。論文已被 ICLR 2026 接收並獲谷歌大力推廣。
Tag: #llm-inference43 results

谷歌推出 TurboQuant 極端壓縮演算法,聲稱可將 AI 記憶體占用降至 1/6、推理速度提升 8 倍,解決大模型 KV Cache 瓶頸。蘇黎世聯邦理工學院中國博士後高健揚指控該論文嚴重誤傳其 RaBitQ 工作,包括未承認關鍵相似性、無證據稱其理論次優,以及不公平實驗設定——這些問題投稿前已提但未修正。論文已被 ICLR 2026 接收並獲谷歌大力推廣。

Google Research 發布 TurboQuant,一套軟體演算法組合,平均壓縮 KV 快取記憶體 6 倍,並加速注意力 logits 計算 8 倍。此無需訓練的解決方案可將企業 AI 推論成本降低 50% 以上,且不損模型智慧。包含 PolarQuant 和 QJL 的開源演算法現已開放,提前於 ICLR 和 AISTATS 2026 會議。

NVIDIA 介紹在 Kubernetes 上部署拆分式 LLM 推論工作負載,解決單一單體服務過程的限制。預填充與解碼階段具有不同計算特性,傳統部署強迫使用相同硬體,導致 GPU 閒置與擴展不靈活。拆分式服務將推論管線分離,提升 GPU 利用率與擴展性。

Hugging Face 推出 SPEED-Bench,這是一個用於評估語言模型推測解碼技術的統一且多樣基準。它標準化了各種方法的測試,以衡量加速與準確度。此工具幫助研究人員有效比較推測解碼方法。

P-EAGLE 在 vLLM 中引入並行推測解碼,以加速 LLM 推理。從 v0.16.0 版本起透過 PR#32887 整合。預訓練檢查點可輕鬆部署優化模型。
中信證券指出NVIDIA GTC即將召開,LPU或成亮點,大模型推理PD分離已成標配。收購Groq後,或推LPU或類LPU晶片提升Decode效率,Rubin CPX針對Prefill降本。建議關注NVIDIA供應鏈核心、LPU佈局企業及國產超節點、算力晶片龍頭。
Together AI 的快取感知預填充-解碼分離(CPD)將溫熱預填充與冷解碼工作負載分離,以實現高效推理。它提供高達 40% 的更高吞吐量,並大幅降低首 token 時間。長提示現在能實現更快回應,而無延遲。

部署 LLM 的組織面臨多樣推理工作負載挑戰,小型嵌入模型僅需數 GB,而 70B+ 參數 LLM 需多 GPU,導致低利用率、高成本與不可預測延遲。NVIDIA Run:ai 與 NIM 透過有效打包工作負載優化資源分配。此整合最大化推理的 GPU 效率。
大型 LLM 推理受 KV 快取記憶體需求限制。蘋果將驅逐問題重構為強化學習,依未來效用排序權杖,並推出 KVP 框架。此法避免如最近性等啟發式代理,降低額外運算負荷。

此架構透過 Curvine 將快取儲存延伸至共享分散式 NVMe 集區,為 Amazon SageMaker HyperPod 加入分層 KV 快取。多個副本可接近本機磁碟的速度重用快取資料,降低使用超大型 GPU 執行個體的需求。