🏠最新收集於 1m

Alibaba 開源 Qwen3.8-Flash MoE 模型

Alibaba 開源 Qwen3.8-Flash MoE 模型
PostLinkedIn
🏠閱讀原文: IT之家
#mixture-of-experts#long-context#open-weights#fp8qwen3.8-flashalibabaqwen3.8-flashqwen4hugging-facemodelscope

💡開放權重、1M token 上下文與九分之一訓練成本,讓 Qwen3.8-Flash 值得實測。

⚡ 30-Second TL;DR

有什麼變化

125B 參數的 MoE 模型每個 token 僅啟用 6B 參數,另加入 51B 的 N-gram Embedding 參數。

為什麼重要

這次發布讓開發者能提前接觸 Qwen4 時代的架構,並透過稀疏啟用與高效記憶體元件大幅降低訓練及推理成本。1M token 上下文支援與開放權重,也可能讓小型團隊更容易開發長上下文應用。

下一步行動

從 Hugging Face 或 ModelScope 下載 Qwen3.8-Flash FP8 權重,並將 1M token 的 Prefill、Decode、編碼與工具使用工作負載與目前模型進行基準測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • 125B 參數的 MoE 模型每個 token 僅啟用 6B 參數,另加入 51B 的 N-gram Embedding 參數。
  • GDN 與 QSA 混合 Attention 架構在 1M token 上下文中,Prefill 最高加速 7.6 倍、Decode 最高加速 4.9 倍。
  • Qwen3.8-Flash-Next-Base 在列出的 14 項基準測試中,有 8 項取得最佳成績,包括 MMLU-Pro 與 SWE-bench-Pretrain。
  • 模型權重與 FP8 量化版本已在 Hugging Face 和 ModelScope 提供;API 定價為每百萬輸入 token 1 元、輸出 token 3 元。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 10 個來源。

🔑 增強重點摘要

  • Qwen3.8-Flash-Next 作為 Qwen4 架構的早期預覽版,旨在讓開發者提前適應並測試即將到來的下一代模型架構。
  • 該模型於 2026 年 8 月 26 日晚間 11 點(北京時間)正式開源,並同步釋出 FP8 量化版本。
  • 此發布緊隨 2026 年 8 月 3 日推出的 2.4 兆參數旗艦模型 Qwen3.8-Max,顯示阿里在短時間內進行了高密度的模型迭代。
  • Qwen 系列模型在全球範圍內表現強勁,過去六個月內累計下載量已突破 30 億次,成為 Meta 與 Google 等國際巨頭的直接競爭對手。
  • 該模型透過 51B 的 N-gram Embedding 表實現快速本地 token 查找,旨在平衡超大規模知識儲存與稀疏激活帶來的推理成本。
📊 競品分析▸ Show
特性Qwen3.8-FlashMoonshot Kimi K3Meta Llama 4 (預估)
架構125B MoE (6B 激活)混合專家模型稠密/稀疏混合
推理加速GDN + QSA (最高 7.6x)專有優化標準 FlashAttention
定價 (輸入/輸出)1元 / 3元 (每百萬)市場競爭定價開源免費
核心優勢高性價比與架構預覽長文本處理能力生態系統廣度

🛠️ 技術深入

  • 採用 GDN (Gated Dynamic Network) 與 QSA (Qwen Self-Attention) 混合架構,專為長上下文推理優化。
  • 具備 125B 總參數規模,透過 MoE 技術實現僅 6B 參數的稀疏激活,顯著降低計算資源需求。
  • 整合 51B 參數的 N-gram Embedding 表,用於加速 token 處理與檢索效率。
  • 支援 1M token 上下文窗口,並在該長度下實現 Prefill 7.6 倍與 Decode 4.9 倍的加速比。

🔮 前景展望AI analysis grounded in cited sources

Qwen4 架構將全面採用 GDN 與 QSA 技術。
Qwen3.8-Flash 作為 Qwen4 的架構預覽,其核心技術組件極大機率將成為未來旗艦模型的標準配置。
阿里將進一步降低 API 推理成本以搶佔市場份額。
Qwen3.8-Flash 的訓練成本僅為前代的九分之一,為後續更激進的價格戰提供了利潤空間。

時間線

2026-08-03
發布 2.4 兆參數的旗艦模型 Qwen3.8-Max。
2026-08-26
正式開源 Qwen3.8-Flash-Next 模型及其 FP8 量化版本。

📎 來源 (10)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. nvidia.com
  2. technode.com
  3. daily.dev
  4. startupfortune.com
  5. enterprisedna.co
  6. medium.com
  7. nvidia.com
  8. yottalabs.ai
  9. medium.com
  10. facebook.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。