Search

Tag: #kv-cache63 results

谷歌 TurboQuant 論文遭 RaBitQ 嚴重質疑

谷歌 TurboQuant 論文遭 RaBitQ 嚴重質疑

谷歌推出 TurboQuant 極端壓縮演算法,聲稱可將 AI 記憶體占用降至 1/6、推理速度提升 8 倍,解決大模型 KV Cache 瓶頸。蘇黎世聯邦理工學院中國博士後高健揚指控該論文嚴重誤傳其 RaBitQ 工作,包括未承認關鍵相似性、無證據稱其理論次優,以及不公平實驗設定——這些問題投稿前已提但未修正。論文已被 ICLR 2026 接收並獲谷歌大力推廣。

Approaching.AI 發佈 ATaaS Token 生產平台

Approaching.AI 發佈 ATaaS Token 生產平台

Approaching.AI(趨境科技)發佈 ATaaS,一個解決 AI 推理中硬體利用率低與成本上升的高效能 AI Token 生產平台。它利用四大核心技術實現異構整合、海量 KV Cache、SLO 仿真與極致彈性擴展。該平台將數據中心轉變為「Token 工廠」,資源效率提升最高達 90%。

雷峰网MediaMar 27#kv-cache#token-production
RotorQuant:比 TurboQuant 快 10-19 倍

RotorQuant:比 TurboQuant 快 10-19 倍

RotorQuant 利用 Clifford 轉子進行向量量化,比 TurboQuant 快 10-19 倍,參數僅 1/44。它在 Qwen2.5-3B KV 快取上餘弦相似度近乎相同(0.990),並在融合 CUDA/Metal 核心中表現出色。程式碼與論文現已開放。

Reddit r/LocalLLaMACommunityMar 26#quantization#kv-cache#cuda
Page 3 of 7