
谷歌 TurboQuant 縮減 AI 記憶體 6 倍
谷歌 TurboQuant 將 AI 記憶體使用量縮減 6 倍,導致 SanDisk 和 Micron 股價下跌。本文拆解其背後的軟硬體博弈。這可能刺激多模態 AI 在企業與消費端的規模化應用。
Tag: #quantization201 results

谷歌 TurboQuant 將 AI 記憶體使用量縮減 6 倍,導致 SanDisk 和 Micron 股價下跌。本文拆解其背後的軟硬體博弈。這可能刺激多模態 AI 在企業與消費端的規模化應用。

Google Research 發布 TurboQuant,一套軟體演算法組合,平均壓縮 KV 快取記憶體 6 倍,並加速注意力 logits 計算 8 倍。此無需訓練的解決方案可將企業 AI 推論成本降低 50% 以上,且不損模型智慧。包含 PolarQuant 和 QJL 的開源演算法現已開放,提前於 ICLR 和 AISTATS 2026 會議。

Google 發表 TurboQuant,一種新壓縮技術,可降低 AI 模型記憶體使用量。它不像其他方法損失輸出品質。此技術提升 AI 部署效率。
Delta-KV 量化 KV 快取差值而非絕對值,在 Llama 70B 上實現近無損 4-bit 壓縮,誤差減 10,000 倍。整合至 llama.cpp 分支,weight-skip 提升 10% 解碼速度。硬體無關、無需訓練。
Nemotron Cascade 2 30B-A3B 在 HumanEval 達 97.6%,超越 Qwen3.5 中型模型,在 ClassEval 達 88%。它是基於 Nemotron 自家架構的混合模型。IQ4_XS 量化版在本機表現優異。

這篇 arXiv 論文探討聯合模型壓縮中剪枝與量化的順序是否重要。它提出漸進強度假說,主張較弱擾動應先於較強者,並提供理論保證。在語言與視覺模型上的廣泛實驗證實其適用於多階段與混合精度設定。

NextMem 是用於 LLM 代理的潛在事實記憶框架,利用自回歸自編碼器實現高效記憶建構與精準重建。它採用兩階段訓練流程,包括自回歸重建對齊與漸進潛在替換,並加入量化以降低儲存開銷。實驗顯示其在檢索、穩健性與擴展性上表現優異;程式碼已在 GitHub 開源。
Mistral-Small-4-119B-2603-GGUF 這款新的量化模型現已推出。在 Reddit 的 r/LocalLLaMA 子版塊由用戶 /u/KvAk_AKPlaysYT 發布。此版本可實現大型 Mistral 模型的高效本地推理。

Mistral 推出首款官方 NVFP4 量化模型 Mistral-Small-4-119B-2603-NVFP4。此模型針對 NVIDIA 硬體,提供大模型高效推論。
開發者讚揚 Qwen 3.5 122B-A10B 在本地應用建置中的自然推理能力。模型透過分析現有 API 路由進行自我引導規劃。強調開放本地 LLM 的強大威力。