🦙較早收集於 16h

llama.cpp 在 500 美元 MacBook Neo 上達 7.8 t/s

llama.cpp 在 500 美元 MacBook Neo 上達 7.8 t/s
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#quantization#metal-gpu#apple-silicon#benchmarkllama.cppllama.cppqwen3.5-9bmacbook-neoapple-a18-pro

💡證明 llama.cpp 在 500 美元 MacBook Neo 上達 4+ t/s – 完美本地 LLM 測試。(48字)

⚡ 30-Second TL;DR

有什麼變化

運行於 MacBook Neo (A18 Pro、8GB RAM、5 核 GPU)

為什麼重要

使入門級 Apple 矽晶片上實現平價本地 LLM 推論,民主化無需高階硬體的開發者存取。突顯 llama.cpp 在 Metal 上的效率。

下一步行動

編譯 llama.cpp 8294,並在你的 Apple Silicon Mac 上使用 -ngl all 測試 Qwen3.5-9B Q3_K_M.gguf。

誰應關注:Developers & AI Engineers

關鍵要點

  • 運行於 MacBook Neo (A18 Pro、8GB RAM、5 核 GPU)
  • Qwen3.5-9B Q3_K_M:提示 7.8 t/s,生成 3.9 t/s
  • 超參數:-ngl all、-c 4096、-b 128、-t 4
  • 更高速配置:9B 達 5 t/s,4B 達 10 t/s

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • llama.cpp 在單使用者或低併發情境下表現優異,其 C++ 核心提供極低 inter-token latency,但高併發時 TTFT 指數級上升[1][2]
  • 與 vLLM 比較,llama.cpp 的吞吐量在多使用者負載下幾乎平坦,vLLM 可達 35 倍 RPS 與 44 倍 TPS[1]
  • 在 M4 Ultra 上,llama.cpp 峰值吞吐量約 150 tokens/sec,優於 Ollama 的 35-41 tokens/sec,但遠低於 vLLM 在 RTX 5090 的 5841+ tokens/sec[2]
  • llama.cpp 支援高 VRAM 效率的 offloading,設定時間約 10-20 分鐘,適合本地單機部署[2]
  • 近期版本修復 Qwen 系列模型長提示崩潰問題,並優化 Metal/Vulkan 後端效能[5]
📊 競品分析▸ Show
框架峰值吞吐量 (tokens/sec)P99 TTFTVRAM 效率設定時間最佳情境
llama.cpp (M4 Ultra)~150隨負載指數上升高 (支援 offloading)10-20 分單使用者/低併發
Ollama (M4 Ultra)35-41高 (佇列瓶頸)中等1 分鐘快速部署
vLLM (RTX 5090)5,841+穩定 <100ms菁英 (PagedAttention)1-2 小時高併發生產[2]

🛠️ 技術深入

  • llama.cpp 使用線性佇列模型處理請求,導致高併發時 TTFT 指數上升,適合單流處理而非動態排程[1][2]
  • 典型基準命令:./main --model model.bin --ctx-size 2048 --batch-size 512 --threads 1 --n-gpu-layers 99,eval time 不含 CPU 開銷如 sampling[4]
  • Metal GPU 加速下支援 -ngl all 將所有層 offload 至 GPU,搭配 -t 4 (4 執行緒) 與 -b 128 batch size 優化 Apple Silicon[原文]。
  • Q3_K_M 量化為 3-bit 權重,平衡記憶體與精度,適合 8GB RAM 裝置運行 9B 模型[原文]。
  • 近期更新修復 Qwen3.5 MoE 長提示 (20k tokens) 下的 CUDA segfault,並改善多 GPU op-offload 穩定性[5]

🔮 前景展望AI analysis grounded in cited sources

Apple Silicon 將主導入門級本地 LLM 市場
500 美元 MacBook Neo 達 7.8 t/s 顯示 A18 Pro + llama.cpp 組合大幅降低高效能 AI 門檻,挑戰 x86/高階 GPU 主導地位[原文][2]
llama.cpp 將專注邊緣設備優化而非伺服器高併發
其單使用者低延遲優勢與 vLLM 生產環境差距明確,未來發展將強化 Metal/Vulkan 而非排程架構[1][2]
Qwen 系列將成低階硬體首選模型
Qwen3.5-9B 在 8GB RAM 達實用速度,結合 llama.cpp 量化支援優於同級 Llama 模型[原文][5]

時間線

2023-07
llama.cpp 啟動效能基準收集,聚焦 CPU 測試與 ggml 模型支援[4]
2025-03
發布穩定版本,提升處理速度並修復多項 bug,強化 Metal 支援[5]
2025-09
與 vLLM 頭對頭基準測試,確立單使用者優勢與高併發限制[1]
2026-02
修復 Qwen3.5 MoE 長提示崩潰,優化 Vulkan/CPU 後端效能[5]
2026-03
第 8294 版在 MacBook Neo (A18 Pro) 達 7.8 t/s 破紀錄[原文]
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。