Search

Tag: #quantization201 results

🤖

Gemma 4:MLX 在 M1 Max 上落後 GGUF

使用者在 M1 Max 硬體上基準測試 google/gemma-4-26b-a4b 的 MLX 和 GGUF 格式,使用 3k 權杖提示。GGUF 提示處理更快(4.28s 對 6.32s),權杖/秒相似,並有更好的並行支援。未觀察到 MLX 的明顯效能優勢。

Reddit r/LocalLLaMACommunityApr 19#apple-silicon#quantization
Page 17 of 21