Gemma-4-26B A4B 在 M5 MacBook 快速運行
Gemma-4-26B-A4B-IT-UD-IQ4_XS 在 32GB M5 MacBook Air 上達 300 t/s PP 及 12 t/s 生成,功耗 8W,保持涼爽安靜。用戶報告提示處理比 M1 Max 快 25%,Opencode 代理編碼電池續航 6 小時。本地使用能力強,但比 Claude 等閉源模型需更多引導。
Tag: #quantization201 results
Gemma-4-26B-A4B-IT-UD-IQ4_XS 在 32GB M5 MacBook Air 上達 300 t/s PP 及 12 t/s 生成,功耗 8W,保持涼爽安靜。用戶報告提示處理比 M1 Max 快 25%,Opencode 代理編碼電池續航 6 小時。本地使用能力強,但比 Claude 等閉源模型需更多引導。

AnythingLLM 的 Tim 測試了 Bonsai 8B 模型,在 M4 Max MacBook Pro 上用於聊天、文件摘要、工具呼叫等任務表現出色,記憶體使用低。比之前的 MSFT BitNet 等 1 位元模型優秀,體積小 14 倍。需要特殊 llama.cpp fork 支援。

全新 APEX MoE 模型量化技術,在準確度上優於 Unsloth Dynamic 2.0 且體積減半,以 Qwen3.5-35B-A3B 為基準。提供從 12GB VRAM 的 GPU 等級,兼容標準 llama.cpp,並透過 TurboQuant 提示處理加速 14%。開源,模型在 Hugging Face。

attn-rot 功能,一種類似 TurboQuant 的 KV 快取優化,已整合至 llama.cpp。它帶來 TurboQuant 80% 的效益,幾無缺點。Q8 量化現效能近似 F16。

llama.cpp 的新 3.5 位元量化格式 TQ3_1S 在 Qwen3.5-27B 上達到接近 Q4_0 的困惑度,體積小 10% 僅 12.9GB。它讓 16GB RTX 5060 Ti 能完整載入 GPU。格式採用 Walsh-Hadamard 旋轉、8 質心量化及雙半區塊尺度,並支援 CUDA。

ggerganov 的 attn-rot(TurboQuant lite)即將合併進 llama.cpp,為 Qwen3.5 模型提供更低的 KV 量化 KLD 誤差。基準測試顯示 35B、27B 和 122B 變體在 VRAM 和 CPU 上 q4_0 品質提升且速度相當。本地推理速度預期加快。

ByteShape 發布 Qwen 3.5 9B 量化版本,並跨 5090/4080 等 GPU 及 CPU 基準測試。GPU 關鍵選擇:5.10 bpw 基準、4.43 bpw 平衡、3.60 bpw 快速。部落格提供互動圖表供硬體特定選擇;首波 Qwen 發布,後續更多。

開源 PickyTrain 工具允許無 GPU 或訓練直接外科式編輯 GGUF 模型個別權重。具語意辨識注意力頭等張量、影響警告、漂移護欄及完整回滾。Rust 核心配 Python 綁定支援常見量化;早期釋出尋求貢獻者。

谷歌推出 TurboQuant 極端壓縮演算法,聲稱可將 AI 記憶體占用降至 1/6、推理速度提升 8 倍,解決大模型 KV Cache 瓶頸。蘇黎世聯邦理工學院中國博士後高健揚指控該論文嚴重誤傳其 RaBitQ 工作,包括未承認關鍵相似性、無證據稱其理論次優,以及不公平實驗設定——這些問題投稿前已提但未修正。論文已被 ICLR 2026 接收並獲谷歌大力推廣。
TurboQuant 在量化前對向量施加隨機旋轉,解量化時施加對應反旋轉,提升向量量化效果。此舉對抗 LLM 狀態向量的準稀疏結構,避免資訊損失。此簡單技巧大幅提升效能,無需複雜依賴。