🦙Reddit r/LocalLLaMA•最新收集於 3h
llama.cpp 或已縮小 MLX 在 M5 上的預填充優勢
#apple-silicon#metal-acceleration#inference-benchmarkllama.cpp-metalllama.cppmlxqwen3.8apple m5
💡了解 llama.cpp 是否已在 Apple M5 上追上 MLX 的 Qwen3.8 預填充效能。
⚡ 30-Second TL;DR
有什麼變化
使用 Unsloth Q8 GGUF 的提示預填充速度據報約為每秒 300–350 tokens。
為什麼重要
若經獨立測試確認,此變化可能讓 GGUF 同時適用於提示處理與生成,進而簡化 Mac 推理架構。不過,由於報告聚焦於單一模型、量化範圍與 Apple 晶片世代,實務人員應將其視為觀察結果,而非普遍適用的基準結論。
下一步行動
在移除 MLX 部署堆疊前,先於你的 M5 硬體上,以相同提示長度與生成長度測試 llama.cpp Metal GGUF 和 MLX。
誰應關注:Developers & AI Engineers
關鍵要點
- •使用 Unsloth Q8 GGUF 的提示預填充速度據報約為每秒 300–350 tokens。
- •在 M5 Pro 上執行 Qwen3.8 27B 時,生成速度約為每秒 19 tokens。
- •llama.cpp Metal 似乎受益於對 M5 矩陣乘法或神經加速器的支援。
- •比較結果仍可能取決於工作負載與模型,而主流 MLX MTP 支援仍有待確認。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。


