🦙Reddit r/LocalLLaMA•最新收集於 3h
Qwen 3.8 Flash Next 獲重大 Mac 最佳化

#mac-optimization#metal#sparse-attention#speculative-decodingqwen-3.8-flash-next-for-llama.cppqwen 3.8 flash nextllama.cppapple siliconunslothatomicchat
💡客製化 llama.cpp 分支宣稱可讓 64GB Apple Silicon Mac 上的 Qwen 解碼速度提升 70%。
⚡ 30-Second TL;DR
有什麼變化
此實作可在 M1 Max 系統上從 SSD 串流 tensors、engrams 與 MTP 資料。
為什麼重要
這項工作可能讓記憶體受限的 Mac 更容易進行大型模型實驗,而不必使用獨立 GPU。解碼加速與預填充變慢之間存在取捨,因此最佳配置取決於工作負載是互動生成還是長上下文處理。
下一步行動
在你的 Mac 上複製這個客製化 llama.cpp 分支,於 4K 與 256K context 分別測試啟用及停用 MTP 的 Q4_0 效能。
誰應關注:Developers & AI Engineers
關鍵要點
- •此實作可在 M1 Max 系統上從 SSD 串流 tensors、engrams 與 MTP 資料。
- •自訂 Q4 量化整合多個 Unsloth 與 AtomicChat 量化版本的 tensors,以提升每 bit 效能。
- •MTP 可將解碼速度提升至約每秒 22 tokens,但在 4K context 下,預填充速度會由每秒 180 tokens 降至約 170 tokens。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 10 個來源。
🔑 增強重點摘要
- •Qwen 3.8 Flash Next 作為 Qwen 4 架構的實驗性預覽版,採用了混合專家模型 (MoE) 設計,總參數規模達 1250 億,但每個 token 僅啟用 60 億參數。
- •該模型具備 256,000 token 的原生上下文視窗,旨在支援長序列任務與複雜的代理人 (agentic) 工作流程。
- •除了 SSD 串流技術,該模型透過 MTPLX 執行環境實現了針對 Apple Silicon 的深度最佳化,特別是針對 MTP 推測解碼的硬體加速。
- •在 M5 Max 晶片上,MTP 推測解碼技術可帶來 1.6 倍至 1.7 倍的推理速度提升,顯示出該架構在最新硬體上的擴展潛力。
- •該模型包含一個 32GB 的 n-gram 嵌入表,允許在記憶體受限的系統上透過 SSD 串流技術運行,同時保持核心權重常駐於統一記憶體中。
📊 競品分析▸ Show
| 特性 | Qwen 3.8 Flash Next | GLM 5.3 Flash |
|---|---|---|
| 架構 | 125B MoE (6B 活躍) | 未公開 (輕量化 MoE) |
| 上下文視窗 | 256K | 128K |
| 部署重點 | 本地推理/Apple Silicon 優化 | 高吞吐量/雲端 API |
| 發布日期 | 2026-08-26 | 2026-08-26 |
🛠️ 技術深入
- 架構類型:混合專家模型 (MoE),總參數 125B,活躍參數 6B。
- 推理加速:整合 MTPLX 執行環境,支援原生 MTP (Multi-Token Prediction) 推測解碼頭。
- 記憶體管理:支援 32GB n-gram 嵌入表 SSD 串流,降低對統一記憶體容量的硬性需求。
- 部署要求:針對 Apple Silicon (M1 Max 至 M5 Max) 進行了指令集層級的算子融合。
🔮 前景展望AI analysis grounded in cited sources
Qwen 4 將全面採用 MoE 架構
Qwen 3.8 Flash Next 作為 Qwen 4 的架構預覽,明確展示了 MoE 在平衡效能與推理成本上的核心地位。
本地 LLM 將突破記憶體容量限制
透過 SSD 串流 n-gram 嵌入表與權重分層技術,未來本地模型將能運行遠超硬體記憶體容量的參數規模。
⏳ 時間線
2026-08-14
發布 Qwen 3.8 27B 模型
2026-08-26
發布 Qwen 3.8 Flash Next 預覽版
📎 來源 (10)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。

