Gemma 4:MLX 在 M1 Max 上落後 GGUF
使用者在 M1 Max 硬體上基準測試 google/gemma-4-26b-a4b 的 MLX 和 GGUF 格式,使用 3k 權杖提示。GGUF 提示處理更快(4.28s 對 6.32s),權杖/秒相似,並有更好的並行支援。未觀察到 MLX 的明顯效能優勢。
Tag: #quantization201 results
使用者在 M1 Max 硬體上基準測試 google/gemma-4-26b-a4b 的 MLX 和 GGUF 格式,使用 3k 權杖提示。GGUF 提示處理更快(4.28s 對 6.32s),權杖/秒相似,並有更好的並行支援。未觀察到 MLX 的明顯效能優勢。

使用者基準測試 Qwen 3.6 35B A3B 在 RTX 5090 32GB 上以 Q5 K S 量化達 187 權杖/秒。使用 120K 脈絡大小、關閉思考模式及溫度 0.1。在新 NVIDIA 硬體上展現高本地推理速度。
llama.cpp、mlx、vllm 和 sglang 中的 TurboQuant 實作討論顯得雜亂且疑似 AI 生成。使用者質疑論文主張如無損壓縮是否經獨立驗證。重現 TurboQuant+QJL 設定導致效能變差。
用戶報告自2026年4月中旬起,Claude Sonnet/Opus、Gemini、z.ai 和 Grok 等模型智慧大幅下降。模型忽略指令、回應緩慢且輸出淺薄。本地於租用 H100 的 GLM5 在相同提示下表現優於託管版本。
512 維 32 位 ArcFace 嵌入超過 Postgres TOAST 門檻,導致透過 TOAST 表額外 I/O。建議 16 位 HALFVEC 量化減半儲存/I/O 並內嵌儲存。預期現實世界精準度損失可忽略。
使用者讚揚 Qwen 3.5 27B IQ3 量化版適合 32k 上下文,在 RTX 4080 上以 llama.cpp 達 40+ t/s。探討 Gemma 26B MoE IQ4 搭配 turboquant KV 快取。強調 16GB 卡上量化速度與品質權衡。
貼文討論 Gemma 4 26B A4B q4_k_m 的 Bartowski 量化與 OpenRouter/AI Studio 完整模型效能比較。使用者報告 Bartowski 量化表現極佳。尋求社群對 26B A4B 和 31B 最佳量化的見解。
Gemma4 26B A4B 透過全 CPU 模式及 4-5 位元量化,在 16GB Mac 上以 6-10 tps 運行。將 GPU 層設為 0 並降低批次大小以確保可用性。LMStudio 修正使用自訂 Jinja 範本啟用思考。
用戶分享 Gemma-4-26B-A4B 等 GGUF 模型量化詳細配方,需要 500GB 儲存空間及架構特定設定。感謝 unsloth、bartowski 等量化者;Hugging Face 上提供完整 REPRODUCE.md。