Search

Tag: #kv-cache63 results

🔬

RaBitQ 作者澄清 TurboQuant 誤述

RaBitQ 論文作者公開澄清 TurboQuant 對其方法的描述不完整且不準確,包括理論保證和實證比較。他們強調遺漏如隨機旋轉等關鍵步驟,以及不當的次優聲明,儘管先前已通知。貼文旨在糾正本地 LLM 推論社群在 ICLR 2026 前夕的混淆。

Reddit r/LocalLLaMACommunityMar 30#kv-cache#quantization#iclr-2026
Qwen3.5-27B FP8 效能媲美 BF16

Qwen3.5-27B FP8 效能媲美 BF16

使用者使用 vLLM 對 Qwen3.5-27B 進行基準測試,比較原始 BF16 權重/16 位元 KV 快取與 Qwen 的 FP8 量化及 8 位元 KV 快取。結果幾乎相同,歸因於單次執行隨機噪聲。建議使用 FP8 權重與快取,大幅擴展上下文長度。

Reddit r/LocalLLaMACommunityMar 16#quantization#kv-cache#benchmark
SideQuest:模型驅動 KV 快取管理,用於長時程代理推理

SideQuest:模型驅動 KV 快取管理,用於長時程代理推理

SideQuest 利用大型推理模型 (LRM) 本身,透過推理上下文 token 的有用性來壓縮 KV 快取,適用於長上下文代理任務。它將壓縮視為平行輔助任務執行,避免汙染主要推理上下文。僅用 215 個樣本訓練的模型評估顯示,峰值 token 使用量減少 65%,準確度損失極小,優於啟發式方法。

Page 6 of 7