TurboQuant 將 LLM 記憶體減 6 倍
Google 的 TurboQuant AI 壓縮演算法將 LLM 記憶體使用減 6 倍而不損輸出品質。Ars Technica 文章強調效率提升。用於家用大型模型部署的希望。
Tag: #model-compression25 results
Google 的 TurboQuant AI 壓縮演算法將 LLM 記憶體使用減 6 倍而不損輸出品質。Ars Technica 文章強調效率提升。用於家用大型模型部署的希望。
TurboQuant 將演算法適應至 LLM 權重壓縮,提供 nn.Linear 即插即用替代方案,具近最佳 4 位元量化與無損 8 位元殘差。在 Qwen3.5-0.8B 上基準測試顯示 8 位元總計 PPL 零增加與 3.2 倍記憶體縮減。GitHub 提供完整文件、基準與 Triton 核心。

Google 發表 TurboQuant,一種新壓縮技術,可降低 AI 模型記憶體使用量。它不像其他方法損失輸出品質。此技術提升 AI 部署效率。

Google Research 推出 TurboQuant,這是一種透過極端模型壓縮重新定義 AI 效率的新技術。在 Reddit r/LocalLLaMA 上分享,預示大型模型以更少資源運行的重大進展。

Multiverse Computing 已壓縮來自 OpenAI、Meta、DeepSeek 和 Mistral AI 的 AI 模型。公司推出了一款展示這些模型能力的 App,以及一個讓它們更廣泛可用的 API,將壓縮 AI 推向主流。

研究人員無量化壓縮 6 款 LLM 的 MLP 層,發現降質差異驚人。Gemma 2B 在 14% 壓縮下保留 92% 準確率,而 Llama 3.1 8B 降至 85%。提供標準 HF 檢查點,適用 vLLM、TGI 和 llama.cpp。

bitsandbytes 創作者 Tim Dettmers 正預告一種新的量化方法,據稱可在單台 DGX Spark 上以 7 tok/s 執行 GLM 5.3。相關說法尚未獲得驗證,社群也提醒,許多看似有前景的量化方案最終並未實際普及。

Hugging Face 探討如何讓知識蒸餾的成本降低至足以大規模運行。文章聚焦於降低將大型模型能力轉移至小型模型時的實際成本門檻。

AHC 是一種元學習框架,用於記憶體低於 100KB 的微控制器 (MCU) 持續物件偵測的自適應壓縮。它使用 5 步 MAML 適應、階層式尺度感知壓縮,以及雙記憶體整合。在 CORe50、TiROD 和 PASCAL VOC 上超越基準,並有遺忘界理論保證。

南非創辦的 Refiant AI 籌集了 500 萬美元資金。此資金將支持其 AI 模型的壓縮與重構工具。此工具可讓模型在較小或本地機器上高效運行。