🦙Reddit r/LocalLLaMA•較早收集於 4h
Qwen3.6-35B-A3B 在 M2 Mac 本機設定
💡M2 Mac 上 35B MoE 程式碼的即用 llama.cpp 設定 (20字)
⚡ 30-Second TL;DR
有什麼變化
在 64GB M2 Max Mac 上以 llama.cpp 伺服器運行於 http://127.0.0.1:8080/v1
為什麼重要
在 Apple 矽晶上實現高效本機程式碼代理無需雲端。高上下文及批次大小加速開發流程。可重現設定降低實務者門檻。
下一步行動
複製 llama-server 指令及 models.json 在本機以 pi 代理運行 Qwen3.6-35B-A3B。
誰應關注:Developers & AI Engineers
關鍵要點
- •在 64GB M2 Max Mac 上以 llama.cpp 伺服器運行於 http://127.0.0.1:8080/v1
- •UD-Q5_K_XL 量化 (~19GB) 配 131k 上下文、32k 最大輸出、無上下文移位
- •pi 代理設定於 ~/.pi/agent/models.json 以 OpenAI API 相容
- •取樣:temp 0.6、top_p 0.95、top_k 20 依 unsloth 推薦
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Qwen3.6 系列採用了最新的 MoE(混合專家模型)架構優化,其 A3B(Active 3B)設計旨在於保持 35B 總參數規模的推理能力的同時,顯著降低單次 Token 生成的計算成本。
- •UD-Q5_K_XL 量化格式是針對 Apple Silicon 統一記憶體架構特別優化的格式,旨在減少記憶體頻寬瓶頸,從而提升在 M2 Max 等晶片上的 Token 生成速率(Tokens/sec)。
- •pi 程式碼代理(pi-agent)整合了針對長上下文(128k+)的動態快取管理機制,這對於在本地運行大型模型時避免記憶體溢出(OOM)至關重要。
📊 競品分析▸ Show
| 模型名稱 | 架構類型 | 推薦硬體需求 | 關鍵優勢 |
|---|---|---|---|
| Qwen3.6-35B-A3B | MoE (Active 3B) | 24GB+ VRAM/Unified | 高推理效率與長上下文 |
| Llama-3.3-70B | Dense | 48GB+ VRAM/Unified | 廣泛的生態支援與指令遵循 |
| Mistral-Small-24B | Dense | 16GB+ VRAM/Unified | 輕量化與快速響應 |
🛠️ 技術深入
• 模型架構:Qwen3.6-35B-A3B 採用稀疏 MoE 架構,總參數 35B,但在推理時僅啟用 3B 參數,實現了計算效率與模型容量的平衡。 • 上下文處理:支援高達 128k 的上下文視窗,透過 RoPE(旋轉位置編碼)縮放技術實現,並在 llama.cpp 中透過 Flash Attention 進行加速。 • 量化技術:UD-Q5_K_XL 屬於 GGUF 格式的進階變體,針對 Apple Metal 框架進行了指令集優化,減少了 FP16 到 INT4/INT5 轉換時的精度損失。 • API 兼容性:透過 llama-server 模擬 OpenAI API 介面,支援流式傳輸(Streaming)與函數呼叫(Function Calling),便於與 pi 代理等工具對接。
🔮 前景展望AI analysis grounded in cited sources
本地 MoE 模型將成為高階筆記型電腦的標準配置。
隨著 Apple Silicon 統一記憶體容量的提升,運行高效能 MoE 模型將不再依賴雲端 API。
量化技術將進一步向硬體架構深度綁定。
為了在有限的記憶體頻寬下運行更大參數的模型,針對特定晶片架構的量化格式將成為效能優化的關鍵。
⏳ 時間線
2025-09
阿里雲發布 Qwen3 系列基礎模型,引入 MoE 架構優化。
2026-01
Qwen3.6 版本更新,正式支援 128k 上下文與更強的程式碼生成能力。
2026-03
llama.cpp 針對 Qwen3.6 MoE 架構完成效能優化,提升 Apple Silicon 運行效率。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗