TurboQuant 橫掃 Gemma 4 量化基準
TurboQuant KV 快取量化在 llama.cpp 的 Gemma 4 26B 上表現優異,於 M4 Pro 達 q4_0 品質、~3.1 bits/K 且長上下文加速 34%。逐層異常值感知 K 量化於較低位元率下勝過 Qwen PPL 公開分支。
Tag: #kv-cache63 results
TurboQuant KV 快取量化在 llama.cpp 的 Gemma 4 26B 上表現優異,於 M4 Pro 達 q4_0 品質、~3.1 bits/K 且長上下文加速 34%。逐層異常值感知 K 量化於較低位元率下勝過 Qwen PPL 公開分支。
Gemma-4-31B 以 NVFP4 量化在單張 RTX Pro 6000 GPU 的基準測試顯示,一用戶 64K 上下文生成速度達 44.5 tok/s。KV 快取使用 FP8 精準度以適應 32GB 模型大小。測試顯示解碼速度與 Qwen3.5 相當,但預填充較慢,建議多用戶長上下文使用快取。

attn-rot 功能,一種類似 TurboQuant 的 KV 快取優化,已整合至 llama.cpp。它帶來 TurboQuant 80% 的效益,幾無缺點。Q8 量化現效能近似 F16。

谷歌推出 TurboQuant 極端壓縮演算法,聲稱可將 AI 記憶體占用降至 1/6、推理速度提升 8 倍,解決大模型 KV Cache 瓶頸。蘇黎世聯邦理工學院中國博士後高健揚指控該論文嚴重誤傳其 RaBitQ 工作,包括未承認關鍵相似性、無證據稱其理論次優,以及不公平實驗設定——這些問題投稿前已提但未修正。論文已被 ICLR 2026 接收並獲谷歌大力推廣。
llama.cpp 中的 TurboQuant 新優化,跳過 V 快取中可忽略注意力權重的去量化,在 M5 Max 32K 上下文達 +22.8% 解碼速度。標準 q8_0 也適用(+5%),困惑度與 NIAH 分數不變。

Approaching.AI(趨境科技)發佈 ATaaS,一個解決 AI 推理中硬體利用率低與成本上升的高效能 AI Token 生產平台。它利用四大核心技術實現異構整合、海量 KV Cache、SLO 仿真與極致彈性擴展。該平台將數據中心轉變為「Token 工廠」,資源效率提升最高達 90%。

Google發表TurboQuant,將LLM記憶體消耗減至6分之1,同時維持精度。結合PolarQuant與QJL,將KV快取壓縮至3位元。在NVIDIA H100上計算速度最高提升8倍,適用Gemini等模型。

基準測試顯示 Google 的 TurboQuant 整合至 llama.cpp,在 Apple Silicon 的 Metal 上實現顯著 KV 快取節省。使用者回報在低 VRAM 裝置上可支援更大上下文,並有 MLX 和 VLLM 的 PR。此進展提升本地模型能力,而不取代 RAG。

RotorQuant 利用 Clifford 轉子進行向量量化,比 TurboQuant 快 10-19 倍,參數僅 1/44。它在 Qwen2.5-3B KV 快取上餘弦相似度近乎相同(0.990),並在融合 CUDA/Metal 核心中表現出色。程式碼與論文現已開放。