Gemma 4 在本地測試勝過 Qwen
Gemma 4 26b 在 Mac Studio M1 Ultra 上速度匹配 Qwen3.5 35b,於思考鏈連貫性、視覺理解及多語言任務大幅超越。使用者指出 KV 快取龐大及審查風險,但整體表現獲讚。使用 Q4_K_XL 量化測試。
Tag: #quantization201 results
Gemma 4 26b 在 Mac Studio M1 Ultra 上速度匹配 Qwen3.5 35b,於思考鏈連貫性、視覺理解及多語言任務大幅超越。使用者指出 KV 快取龐大及審查風險,但整體表現獲讚。使用 Q4_K_XL 量化測試。
模擬探討Qwen3.5模型使用1位元權重與TurboQuant KV快取,大幅降低記憶體使用。例如122B模型從156GB降至18GB。這可能改變開源大型模型部署。
RaBitQ 論文作者公開澄清 TurboQuant 對其方法的描述不完整且不準確,包括理論保證和實證比較。他們強調遺漏如隨機旋轉等關鍵步驟,以及不當的次優聲明,儘管先前已通知。貼文旨在糾正本地 LLM 推論社群在 ICLR 2026 前夕的混淆。
Alibaba 的 MNN 框架透過近期 GitHub commit 新增 TurboQuant 支援。由貢獻者 wangzhaode 更新,提升量化功能。在 r/LocalLLaMA 發布給本地推論社群。
文章分析 Google TurboQuant KV 快取壓縮(3-4 位元,零損失)對本地設定與移動推論的影響。探討產出增益、消費 GPU 擴展,以及手機 RAM/電池影響。尋求 mlx/llama.cpp fork 的基準測試。
TurboQuant 論文的 Python 實作實現了無需校準資料的線上向量量化。使用隨機旋轉使座標呈高斯分佈,然後逐維度進行 1D 量化。包含無偏點積修正,適合 KV 快取與向量資料庫。

用戶成功合併 llama.cpp 的 Turbo3 和 gfx906 分支。在 AMD MI50 硬體上運行巨型 Qwen3.5 122B 模型。
TurboQuant 演算法從 KV-cache 適應至模型權重,提供 nn.Linear 直接替換,具近最佳 4 位元量化與無損 8 位元殘差。在 Qwen2.5-0.5B 基準測試中,體積減半卻 PPL 零增加;4B 測試確認損失極小。GitHub 含 Triton 核心與完整文件。
使用者在 Strix Halo 上基準測試並將家用實驗室從三個模型整合至單一 122B Qwen3.5 MoE,達到 27.4 tok/s 並獲最高分數。IQ3 量化在半 VRAM 下性能匹配 Q4_K_M。同時處理電子郵件、財務和攝像頭等多個應用。

TurboQuant 推出極致壓縮技術,重塑 AI 模型效率。由 /u/Benlus 在 Reddit r/MachineLearning 發文分享。此工具有望大幅提升 AI 部署速度與資源利用。