🦙最新收集於 3h

Qwen 3.8 Flash Next 獲重大 Mac 最佳化

Qwen 3.8 Flash Next 獲重大 Mac 最佳化
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#mac-optimization#metal#sparse-attention#speculative-decodingqwen-3.8-flash-next-for-llama.cppqwen 3.8 flash nextllama.cppapple siliconunslothatomicchat

💡客製化 llama.cpp 分支宣稱可讓 64GB Apple Silicon Mac 上的 Qwen 解碼速度提升 70%。

⚡ 30-Second TL;DR

有什麼變化

此實作可在 M1 Max 系統上從 SSD 串流 tensors、engrams 與 MTP 資料。

為什麼重要

這項工作可能讓記憶體受限的 Mac 更容易進行大型模型實驗,而不必使用獨立 GPU。解碼加速與預填充變慢之間存在取捨,因此最佳配置取決於工作負載是互動生成還是長上下文處理。

下一步行動

在你的 Mac 上複製這個客製化 llama.cpp 分支,於 4K 與 256K context 分別測試啟用及停用 MTP 的 Q4_0 效能。

誰應關注:Developers & AI Engineers

關鍵要點

  • 此實作可在 M1 Max 系統上從 SSD 串流 tensors、engrams 與 MTP 資料。
  • 自訂 Q4 量化整合多個 Unsloth 與 AtomicChat 量化版本的 tensors,以提升每 bit 效能。
  • MTP 可將解碼速度提升至約每秒 22 tokens,但在 4K context 下,預填充速度會由每秒 180 tokens 降至約 170 tokens。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 10 個來源。

🔑 增強重點摘要

  • Qwen 3.8 Flash Next 作為 Qwen 4 架構的實驗性預覽版,採用了混合專家模型 (MoE) 設計,總參數規模達 1250 億,但每個 token 僅啟用 60 億參數。
  • 該模型具備 256,000 token 的原生上下文視窗,旨在支援長序列任務與複雜的代理人 (agentic) 工作流程。
  • 除了 SSD 串流技術,該模型透過 MTPLX 執行環境實現了針對 Apple Silicon 的深度最佳化,特別是針對 MTP 推測解碼的硬體加速。
  • 在 M5 Max 晶片上,MTP 推測解碼技術可帶來 1.6 倍至 1.7 倍的推理速度提升,顯示出該架構在最新硬體上的擴展潛力。
  • 該模型包含一個 32GB 的 n-gram 嵌入表,允許在記憶體受限的系統上透過 SSD 串流技術運行,同時保持核心權重常駐於統一記憶體中。
📊 競品分析▸ Show
特性Qwen 3.8 Flash NextGLM 5.3 Flash
架構125B MoE (6B 活躍)未公開 (輕量化 MoE)
上下文視窗256K128K
部署重點本地推理/Apple Silicon 優化高吞吐量/雲端 API
發布日期2026-08-262026-08-26

🛠️ 技術深入

  • 架構類型:混合專家模型 (MoE),總參數 125B,活躍參數 6B。
  • 推理加速:整合 MTPLX 執行環境,支援原生 MTP (Multi-Token Prediction) 推測解碼頭。
  • 記憶體管理:支援 32GB n-gram 嵌入表 SSD 串流,降低對統一記憶體容量的硬性需求。
  • 部署要求:針對 Apple Silicon (M1 Max 至 M5 Max) 進行了指令集層級的算子融合。

🔮 前景展望AI analysis grounded in cited sources

Qwen 4 將全面採用 MoE 架構
Qwen 3.8 Flash Next 作為 Qwen 4 的架構預覽,明確展示了 MoE 在平衡效能與推理成本上的核心地位。
本地 LLM 將突破記憶體容量限制
透過 SSD 串流 n-gram 嵌入表與權重分層技術,未來本地模型將能運行遠超硬體記憶體容量的參數規模。

時間線

2026-08-14
發布 Qwen 3.8 27B 模型
2026-08-26
發布 Qwen 3.8 Flash Next 預覽版

📎 來源 (10)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. ollama.com
  2. atomic.chat
  3. aibusiness.com
  4. huggingface.co
  5. github.com
  6. huggingface.co
  7. atomic.chat
  8. yottalabs.ai
  9. qwen.ai
  10. medium.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。