🦙Reddit r/LocalLLaMA•較早收集於 16h
llama.cpp 在 500 美元 MacBook Neo 上達 7.8 t/s

#quantization#metal-gpu#apple-silicon#benchmarkllama.cppllama.cppqwen3.5-9bmacbook-neoapple-a18-pro
💡證明 llama.cpp 在 500 美元 MacBook Neo 上達 4+ t/s – 完美本地 LLM 測試。(48字)
⚡ 30-Second TL;DR
有什麼變化
運行於 MacBook Neo (A18 Pro、8GB RAM、5 核 GPU)
為什麼重要
使入門級 Apple 矽晶片上實現平價本地 LLM 推論,民主化無需高階硬體的開發者存取。突顯 llama.cpp 在 Metal 上的效率。
下一步行動
編譯 llama.cpp 8294,並在你的 Apple Silicon Mac 上使用 -ngl all 測試 Qwen3.5-9B Q3_K_M.gguf。
誰應關注:Developers & AI Engineers
關鍵要點
- •運行於 MacBook Neo (A18 Pro、8GB RAM、5 核 GPU)
- •Qwen3.5-9B Q3_K_M:提示 7.8 t/s,生成 3.9 t/s
- •超參數:-ngl all、-c 4096、-b 128、-t 4
- •更高速配置:9B 達 5 t/s,4B 達 10 t/s
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 6 個來源。
🔑 增強重點摘要
- •llama.cpp 在單使用者或低併發情境下表現優異,其 C++ 核心提供極低 inter-token latency,但高併發時 TTFT 指數級上升[1][2]。
- •與 vLLM 比較,llama.cpp 的吞吐量在多使用者負載下幾乎平坦,vLLM 可達 35 倍 RPS 與 44 倍 TPS[1]。
- •在 M4 Ultra 上,llama.cpp 峰值吞吐量約 150 tokens/sec,優於 Ollama 的 35-41 tokens/sec,但遠低於 vLLM 在 RTX 5090 的 5841+ tokens/sec[2]。
- •llama.cpp 支援高 VRAM 效率的 offloading,設定時間約 10-20 分鐘,適合本地單機部署[2]。
- •近期版本修復 Qwen 系列模型長提示崩潰問題,並優化 Metal/Vulkan 後端效能[5]。
📊 競品分析▸ Show
| 框架 | 峰值吞吐量 (tokens/sec) | P99 TTFT | VRAM 效率 | 設定時間 | 最佳情境 |
|---|---|---|---|---|---|
| llama.cpp (M4 Ultra) | ~150 | 隨負載指數上升 | 高 (支援 offloading) | 10-20 分 | 單使用者/低併發 |
| Ollama (M4 Ultra) | 35-41 | 高 (佇列瓶頸) | 中等 | 1 分鐘 | 快速部署 |
| vLLM (RTX 5090) | 5,841+ | 穩定 <100ms | 菁英 (PagedAttention) | 1-2 小時 | 高併發生產[2] |
🛠️ 技術深入
- •llama.cpp 使用線性佇列模型處理請求,導致高併發時 TTFT 指數上升,適合單流處理而非動態排程[1][2]。
- •典型基準命令:
./main --model model.bin --ctx-size 2048 --batch-size 512 --threads 1 --n-gpu-layers 99,eval time 不含 CPU 開銷如 sampling[4]。 - •Metal GPU 加速下支援
-ngl all將所有層 offload 至 GPU,搭配-t 4(4 執行緒) 與-b 128batch size 優化 Apple Silicon[原文]。 - •Q3_K_M 量化為 3-bit 權重,平衡記憶體與精度,適合 8GB RAM 裝置運行 9B 模型[原文]。
- •近期更新修復 Qwen3.5 MoE 長提示 (20k tokens) 下的 CUDA segfault,並改善多 GPU op-offload 穩定性[5]。
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2023-07
llama.cpp 啟動效能基準收集,聚焦 CPU 測試與 ggml 模型支援[4]
2025-03
發布穩定版本,提升處理速度並修復多項 bug,強化 Metal 支援[5]
2025-09
與 vLLM 頭對頭基準測試,確立單使用者優勢與高併發限制[1]
2026-02
修復 Qwen3.5 MoE 長提示崩潰,優化 Vulkan/CPU 後端效能[5]
2026-03
第 8294 版在 MacBook Neo (A18 Pro) 達 7.8 t/s 破紀錄[原文]
📎 來源 (6)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- developers.redhat.com — Vllm or Llamacpp Choosing Right LLM Inference Engine Your Use Case
- decodesfuture.com — Llama Cpp vs Ollama vs Vllm Local LLM Stack Guide
- forums.developer.nvidia.com — 356698
- GitHub — 2126
- buttondown.com — Weekly Github Report for Llamacpp February 15 1013
- GitHub — Benchmarks Llama
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。