🦙最新收集於 3h

llama.cpp 或已縮小 MLX 在 M5 上的預填充優勢

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#apple-silicon#metal-acceleration#inference-benchmarkllama.cpp-metalllama.cppmlxqwen3.8apple m5

💡了解 llama.cpp 是否已在 Apple M5 上追上 MLX 的 Qwen3.8 預填充效能。

⚡ 30-Second TL;DR

有什麼變化

使用 Unsloth Q8 GGUF 的提示預填充速度據報約為每秒 300–350 tokens。

為什麼重要

若經獨立測試確認,此變化可能讓 GGUF 同時適用於提示處理與生成,進而簡化 Mac 推理架構。不過,由於報告聚焦於單一模型、量化範圍與 Apple 晶片世代,實務人員應將其視為觀察結果,而非普遍適用的基準結論。

下一步行動

在移除 MLX 部署堆疊前,先於你的 M5 硬體上,以相同提示長度與生成長度測試 llama.cpp Metal GGUF 和 MLX。

誰應關注:Developers & AI Engineers

關鍵要點

  • 使用 Unsloth Q8 GGUF 的提示預填充速度據報約為每秒 300–350 tokens。
  • 在 M5 Pro 上執行 Qwen3.8 27B 時,生成速度約為每秒 19 tokens。
  • llama.cpp Metal 似乎受益於對 M5 矩陣乘法或神經加速器的支援。
  • 比較結果仍可能取決於工作負載與模型,而主流 MLX MTP 支援仍有待確認。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。