Search

Tag: #llm-inference43 results

谷歌 TurboQuant 論文遭 RaBitQ 嚴重質疑

谷歌 TurboQuant 論文遭 RaBitQ 嚴重質疑

谷歌推出 TurboQuant 極端壓縮演算法,聲稱可將 AI 記憶體占用降至 1/6、推理速度提升 8 倍,解決大模型 KV Cache 瓶頸。蘇黎世聯邦理工學院中國博士後高健揚指控該論文嚴重誤傳其 RaBitQ 工作,包括未承認關鍵相似性、無證據稱其理論次優,以及不公平實驗設定——這些問題投稿前已提但未修正。論文已被 ICLR 2026 接收並獲谷歌大力推廣。

Google TurboQuant 加速 AI 記憶 8 倍,成本降 50%

Google TurboQuant 加速 AI 記憶 8 倍,成本降 50%

Google Research 發布 TurboQuant,一套軟體演算法組合,平均壓縮 KV 快取記憶體 6 倍,並加速注意力 logits 計算 8 倍。此無需訓練的解決方案可將企業 AI 推論成本降低 50% 以上,且不損模型智慧。包含 PolarQuant 和 QJL 的開源演算法現已開放,提前於 ICLR 和 AISTATS 2026 會議。

VentureBeatMediaMar 25#kv-cache#quantization#llm-inference
Kubernetes 上拆分式 LLM 推論部署

Kubernetes 上拆分式 LLM 推論部署

NVIDIA 介紹在 Kubernetes 上部署拆分式 LLM 推論工作負載,解決單一單體服務過程的限制。預填充與解碼階段具有不同計算特性,傳統部署強迫使用相同硬體,導致 GPU 閒置與擴展不靈活。拆分式服務將推論管線分離,提升 GPU 利用率與擴展性。

NVIDIA Developer BlogOfficialMar 23#llm-inference#gpu-optimization
Run:ai 與 NIM 提升 GPU 使用率

Run:ai 與 NIM 提升 GPU 使用率

部署 LLM 的組織面臨多樣推理工作負載挑戰,小型嵌入模型僅需數 GB,而 70B+ 參數 LLM 需多 GPU,導致低利用率、高成本與不可預測延遲。NVIDIA Run:ai 與 NIM 透過有效打包工作負載優化資源分配。此整合最大化推理的 GPU 效率。

NVIDIA Developer BlogOfficialFeb 27#gpu-scheduling#llm-inference
⚙️

蘋果 KV 快取驅逐強化學習

大型 LLM 推理受 KV 快取記憶體需求限制。蘋果將驅逐問題重構為強化學習,依未來效用排序權杖,並推出 KVP 框架。此法避免如最近性等啟發式代理,降低額外運算負荷。

Apple Machine LearningOfficialFeb 23#kv-cache#llm-inference
Page 3 of 5