🏠IT之家•最新收集於 1m
Alibaba 開源 Qwen3.8-Flash MoE 模型

#mixture-of-experts#long-context#open-weights#fp8qwen3.8-flashalibabaqwen3.8-flashqwen4hugging-facemodelscope
💡開放權重、1M token 上下文與九分之一訓練成本,讓 Qwen3.8-Flash 值得實測。
⚡ 30-Second TL;DR
有什麼變化
125B 參數的 MoE 模型每個 token 僅啟用 6B 參數,另加入 51B 的 N-gram Embedding 參數。
為什麼重要
這次發布讓開發者能提前接觸 Qwen4 時代的架構,並透過稀疏啟用與高效記憶體元件大幅降低訓練及推理成本。1M token 上下文支援與開放權重,也可能讓小型團隊更容易開發長上下文應用。
下一步行動
從 Hugging Face 或 ModelScope 下載 Qwen3.8-Flash FP8 權重,並將 1M token 的 Prefill、Decode、編碼與工具使用工作負載與目前模型進行基準測試。
誰應關注:Developers & AI Engineers
關鍵要點
- •125B 參數的 MoE 模型每個 token 僅啟用 6B 參數,另加入 51B 的 N-gram Embedding 參數。
- •GDN 與 QSA 混合 Attention 架構在 1M token 上下文中,Prefill 最高加速 7.6 倍、Decode 最高加速 4.9 倍。
- •Qwen3.8-Flash-Next-Base 在列出的 14 項基準測試中,有 8 項取得最佳成績,包括 MMLU-Pro 與 SWE-bench-Pretrain。
- •模型權重與 FP8 量化版本已在 Hugging Face 和 ModelScope 提供;API 定價為每百萬輸入 token 1 元、輸出 token 3 元。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 10 個來源。
🔑 增強重點摘要
- •Qwen3.8-Flash-Next 作為 Qwen4 架構的早期預覽版,旨在讓開發者提前適應並測試即將到來的下一代模型架構。
- •該模型於 2026 年 8 月 26 日晚間 11 點(北京時間)正式開源,並同步釋出 FP8 量化版本。
- •此發布緊隨 2026 年 8 月 3 日推出的 2.4 兆參數旗艦模型 Qwen3.8-Max,顯示阿里在短時間內進行了高密度的模型迭代。
- •Qwen 系列模型在全球範圍內表現強勁,過去六個月內累計下載量已突破 30 億次,成為 Meta 與 Google 等國際巨頭的直接競爭對手。
- •該模型透過 51B 的 N-gram Embedding 表實現快速本地 token 查找,旨在平衡超大規模知識儲存與稀疏激活帶來的推理成本。
📊 競品分析▸ Show
| 特性 | Qwen3.8-Flash | Moonshot Kimi K3 | Meta Llama 4 (預估) |
|---|---|---|---|
| 架構 | 125B MoE (6B 激活) | 混合專家模型 | 稠密/稀疏混合 |
| 推理加速 | GDN + QSA (最高 7.6x) | 專有優化 | 標準 FlashAttention |
| 定價 (輸入/輸出) | 1元 / 3元 (每百萬) | 市場競爭定價 | 開源免費 |
| 核心優勢 | 高性價比與架構預覽 | 長文本處理能力 | 生態系統廣度 |
🛠️ 技術深入
- 採用 GDN (Gated Dynamic Network) 與 QSA (Qwen Self-Attention) 混合架構,專為長上下文推理優化。
- 具備 125B 總參數規模,透過 MoE 技術實現僅 6B 參數的稀疏激活,顯著降低計算資源需求。
- 整合 51B 參數的 N-gram Embedding 表,用於加速 token 處理與檢索效率。
- 支援 1M token 上下文窗口,並在該長度下實現 Prefill 7.6 倍與 Decode 4.9 倍的加速比。
🔮 前景展望AI analysis grounded in cited sources
Qwen4 架構將全面採用 GDN 與 QSA 技術。
Qwen3.8-Flash 作為 Qwen4 的架構預覽,其核心技術組件極大機率將成為未來旗艦模型的標準配置。
阿里將進一步降低 API 推理成本以搶佔市場份額。
Qwen3.8-Flash 的訓練成本僅為前代的九分之一,為後續更激進的價格戰提供了利潤空間。
⏳ 時間線
2026-08-03
發布 2.4 兆參數的旗艦模型 Qwen3.8-Max。
2026-08-26
正式開源 Qwen3.8-Flash-Next 模型及其 FP8 量化版本。
📎 來源 (10)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家 ↗
每週 AI 簡報
每週一封,可隨時退訂。


