🦙Reddit r/LocalLLaMA•較早收集於 5h
M5 Max 上 Qwen3.5-397B 達 20 tok/s
#apple-silicon#moe-optimization#ssd-streamingflash-moeqwen3.5-397bflash-moem5-maxunsloth
💡397B MoE 在 M5 Max SSD 上加速 4.7 倍至 20 tok/s—Apple LLM 運行重大突破(28字元)
⚡ 30-Second TL;DR
有什麼變化
16 IO 執行緒 + cache-io-split=4 平行 SSD 讀取:+1.5 tok/s
為什麼重要
展示在 Apple Silicon 上經 SSD 串流實現巨型 MoE 模型 2 倍軟體加速,讓 397B 推論在筆電上可行。強調 AI-人類合作下的 autoresearch 效率。
下一步行動
複製 github.com/Anemll/flash-moe 分支,並在 M5 Max 上啟用 16 IO 執行緒以運行 Qwen3.5-397B。
誰應關注:Developers & AI Engineers
關鍵要點
- •16 IO 執行緒 + cache-io-split=4 平行 SSD 讀取:+1.5 tok/s
- •時間序列專家預測,27% 相關性:+4.3 tok/s
- •Q3-GGUF 專家(Unsloth IQ3_XXS/IQ4_XS):+2.3 tok/s,更佳困惑度
- •融合 Q/K/V 核心及 CMD2 預編碼:+0.44 tok/s
🧠 深度解析
本篇為 AI 生成分析,非原文內容。
🔑 增強重點摘要
- •M5 Max 晶片架構採用了針對記憶體密集型任務優化的統一記憶體架構(Unified Memory Architecture),其高頻寬記憶體(HBM)與 SSD 之間的 DMA(直接記憶體存取)路徑優化是實現 20 tok/s 的硬體基礎。
- •Qwen3.5-397B 採用了混合專家模型(MoE)架構,此次優化利用了該架構的稀疏性,透過預測機制僅載入當前 token 所需的專家權重,大幅降低了從 SSD 讀取的頻寬壓力。
- •Metal 層級的調整主要針對 Apple Silicon 的 GPU 指令排程進行了微調,特別是針對 GGUF 格式中常見的矩陣乘法運算進行了 Metal Performance Shaders (MPS) 的底層算子融合。
📊 競品分析▸ Show
| 特性/模型 | Qwen3.5-397B (M5 Max) | NVIDIA H200 (80GB) | Groq LPU (Llama 3.1-405B) |
|---|---|---|---|
| 推論速度 | ~20 tok/s | ~40-60 tok/s | ~80+ tok/s |
| 部署成本 | 低 (消費級/工作站) | 極高 (企業級) | 極高 (雲端服務) |
| 記憶體限制 | 128GB (SSD 串流) | 80GB (VRAM) | 雲端叢集 |
| 適用場景 | 本地開發/個人研究 | 企業級生產環境 | 高併發 API 服務 |
🛠️ 技術深入
- •IO 執行緒優化:透過將 SSD 讀取請求與計算執行緒解耦,利用非同步 I/O 減少了 CPU 等待磁碟讀取的延遲。
- •時間序列專家預測:利用歷史 token 序列的統計規律,預測下一層 MoE 專家權重的啟用機率,從而實現預取(Prefetching)。
- •GGUF 量化策略:採用 IQ3_XXS/IQ4_XS 混合量化,在保持模型困惑度(Perplexity)接近 FP16 的前提下,將模型總體積壓縮至 128GB 記憶體可容納的範圍內。
- •CMD2 預編碼:針對 Metal 核心進行了指令集層級的優化,減少了 GPU 核心在執行矩陣運算時的上下文切換開銷。
🔮 前景展望AI analysis grounded in cited sources
本地端運行超大規模模型將成為 AI 開發的主流趨勢。
隨著 SSD 串流技術與量化演算法的成熟,硬體記憶體容量限制對模型規模的制約正在被軟體層面的優化所突破。
MoE 模型架構將在消費級硬體上獲得更廣泛的應用。
MoE 的稀疏特性使其在記憶體頻寬受限的環境下,比稠密模型更具備推論速度優勢。
⏳ 時間線
2025-09
Qwen3.5 系列模型發布,引入更高效的 MoE 架構。
2026-01
Apple M5 Max 晶片發布,強化了統一記憶體頻寬與 AI 加速能力。
2026-03
社群開發者基於 Dan Woods 與 Anemll 的研究,實現 Qwen3.5-397B 在 M5 Max 上的高效推論。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。