🦙較早收集於 56m

Mac Mini M4 32GB:20B LLM 達 34 tok/s

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#local-llm#apple-silicon#benchmarksopenclawopenclawlm-studiounslothgpt-oss-20b

💡Mac Mini M4 基準:OpenClaw/LM Studio 於 20B Q4 達 34 t/s、26k 脈絡

⚡ 30-Second TL;DR

有什麼變化

模型:unsloth gpt-oss-20b-Q4_K_S.gguf,脈絡 26035 令牌。

為什麼重要

證明 Mac Mini M4 適合 20B 模型快速本地推論,助桌面 AI 開發者。凸顯 OpenClaw/LM Studio 組合無需獨立 GPU 即高性能。

下一步行動

在你的 Mac Mini M4 上以 gpt-oss-20b-Q4_K_S.gguf 基準測試 OpenClaw。

誰應關注:Developers & AI Engineers

關鍵要點

  • 模型:unsloth gpt-oss-20b-Q4_K_S.gguf,脈絡 26035 令牌。
  • 效能:34 tok/s 解碼,首提示後 0.7s TTFT。
  • 設定:OpenClaw 2026.3.8、LM Studio 0.4.6+1、GPU 卸載=18、flash attention=開。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • GPT-OSS-20B 在推理基準中超越 GPT-4o 的數學問題解決與邏輯推論表現,並與 o3-mini 在函數呼叫任務匹敵[1]
  • 模型支援三種推理等級(低、中、高),可透過系統提示調整以平衡速度與深度分析[3][4]
  • Q4_K_S.gguf 量化檔案大小約 11.6 GB,適合 14GB 以上統一記憶體以達最佳 6+ tok/s 推論速度[3][6]
  • Unsloth 框架使 QLoRA 微調全 20B 模型僅需 14GB VRAM,並優化 GGUF 匯出流程[1]

🛠️ 技術深入

  • 模型採用原生 MXFP4 量化於 MoE 層,使 20B 版本可在 16GB 記憶體內運行,並具備代理功能如函數呼叫、網頁瀏覽與 Python 程式碼執行[4]
  • 推理等級設定:低等級優化快速回應、一般對話;中等級平衡效能;高等級提供深度分析但延遲較高,可經系統提示如 'Reasoning: high' 指定[3][4]
  • Unsloth Dynamic 2.0 GGUF 量化優化,Q4_K_S 適合消費者硬體,檔案大小 11.6 GB,推薦總可用記憶體(統一記憶體 + VRAM + RAM)超過模型大小以達最快速度[3][6]
  • 微調支援:QLoRA 訓練全 20B 模型僅需 14GB VRAM,比傳統方法快 1.5 倍且 VRAM 消耗少 70%,但 GGUF 匯出需 LoRA bf16 權重導致更高 VRAM 需求[1]

🔮 前景展望AI analysis grounded in cited sources

Mac Mini M4 32GB 將成為 20B 級開源 LLM 消費者端首選硬體
34 tok/s 在 26k 脈絡的效能證明 Apple Silicon 在記憶體受限環境下優於傳統 GPU 卸載,降低企業級 AI 門檻[原文章][3]
GPT-OSS-20B 將加速開源模型代理應用開發
內建函數呼叫與高推理效能結合 Unsloth 高效微調,使開發者能在單機上建構複雜代理系統[1][4]

時間線

2026-03
unsloth 發布 gpt-oss-20b-GGUF 量化模型系列
2026-03
Mac Mini M4 32GB 基準測試達 20B LLM 34 tok/s
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。