來源AWS Machine Learning Blog•最新收集於 4h
在 SageMaker 上部署 Qwen3.8-2.4T-A95B

#open-weight#nvfp4#speculative-decodingqwen3.8-2.4t-a95bqwen3.8-2.4t-a95bamazon-sagemakerhyperpodvllm
💡了解如何用 AWS 技術堆疊服務支援推理與工具使用的 2.4T 開放權重模型。
⚡ 30 秒速覽
有什麼變化
部署目標是 2.4 兆參數的 Qwen3.8-2.4T-A95B 模型。
為什麼重要
這降低了透過 AWS 託管基礎架構服務超大型開放權重模型的門檻。團隊無須從零建置完整服務堆疊,即可評估進階推理與工具使用工作負載。
下一步行動
依照 AWS 指南在小型 HyperPod 叢集上部署,並將 NVFP4 吞吐量與目前的 vLLM 部署進行基準測試。
誰應關注:Developers & AI Engineers
關鍵要點
- •部署目標是 2.4 兆參數的 Qwen3.8-2.4T-A95B 模型。
- •服務架構使用 SageMaker HyperPod 與 vLLM。
- •部署流程包含 NVFP4 量化。
- •端點支援推理、工具呼叫與原生 MTP 推測解碼。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 4 個來源。
🔑 增強重點摘要
- •該部署指南由 AWS 技術專家 Dmitry Soldatkin、Andrew Smith 與 Vinay Arora 撰寫,為 AWS 超兆級開源模型 HyperPod 系列部署指南的第二篇(前篇為月之暗面的 Kimi K3)。
- •阿里巴巴 Qwen 團隊於 2026 年 8 月 12 日推出 Qwen3.8-2.4T-A95B,為該團隊首次將旗艦級「Max 系列」(Qwen3.8-Max 對應版本)完全以開放權重(Open-Weight)形式釋出。
- •模型總參數量達 2.4 兆,採用細粒度混合專家(MoE)架構,包含 512 個路由專家與 1 個共享專家,每個 Token 僅動態啟動 10 個路由專家(單一 Token 僅啟動 950 億參數)。
- •底層架構包含 92 層,採用「3 層 Gated DeltaNet → MoE 加上 1 層 Gated Attention → MoE」的混合線性與全局注意力循環佈局,並原生支援高達 262,144(262K)Token 的上下文長度。
- •AWS 指定的部署目標硬體架構為搭載 8 顆 NVIDIA B300 Blackwell Ultra GPU 的 Amazon SageMaker HyperPod ml.p6-b300 執行個體,且模型原生內建不可關閉的
思維鏈推理機制。
📊 競品分析▸ Show
| 模型 / 方案 | 開發主體 | 總參數量 / 活化參數 | 架構特性 | 上下文長度 | 部署硬體建議 |
|---|---|---|---|---|---|
| Qwen3.8-2.4T-A95B | 阿里巴巴 / AWS 部署指南 | 2.4T 總參數 / 95B 活化參數 | 512 路由專家 (啟動 10 個) + 1 共享專家;3x DeltaNet + 1x Attention 混合架構;原生強制思考模式 | 262K (可擴展至 1M) | SageMaker HyperPod ml.p6-b300 (8× NVIDIA B300 NVFP4) |
| Kimi K3 | 月之暗面 (Moonshot AI) | 兆級參數規模 (Trillion-scale) | MoE 混合專家架構,長文本與自主思考代理優化 | 200K+ 長文本支援 | SageMaker HyperPod 叢集方案 |
🛠️ 技術深入
- 模型總量與專家配置:總參數規模達 2.4 兆(2.4T),採用細粒度 MoE(Mixture-of-Experts)稀疏活化機制,全模型配置 512 個路由專家與 1 個共享專家,推論時每個 Token 僅啟動 10 個路由專家,實際活化參數量為 950 億(95B)。
- 混合注意力佈局:共包含 92 層網路結構,採用混合式線性與標準注意力週期結構,以「
3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE)」循環堆疊,大幅提升長序列吞吐量並降低計算負載。 - 上下文長度:原生支援 262,144 Tokens(262K)長上下文視窗,可延伸支援至約 100 萬(1M)Tokens,專注於長程程式碼庫導航與大規模文件理解。
- 硬體執行環境:針對 Amazon SageMaker HyperPod 的
ml.p6-b300執行個體進行最佳化,單節點配置 8 顆 NVIDIA B300 Blackwell Ultra GPU。 - 推論加速與量化棧:採用 vLLM 推論引擎,結合 NVFP4 低精度量化技術壓縮 2.4T 權重以符合記憶體限制,並透過原生多 Token 預測(Multi-Token Prediction, MTP)進行推測解碼,顯著縮減首字延遲與提升生成速率。
- 強制推理模式:原生內建不可跳過的推理模式,所有回應預設自動在
<think>區塊內生成多步驟思維鏈(CoT),以利複雜 Agent 規劃與工具呼叫。
🔮 前景展望基於引用來源的 AI 分析
企業私有雲部署超兆級開源模型進入 Blackwell NVFP4 時代
藉由 NVFP4 量化技術與 B300 GPU 叢集,企業得以在託管叢集(如 SageMaker HyperPod)上以合理成本落地 2.4T 參數規模的旗艦開源模型。
混合線性注意力(DeltaNet + Attention)將成為超長上下文兆級 MoE 模型的主流架構
結合 DeltaNet 線性運算與傳統 Gated Attention 的週期佈局有效解決了 262K 乃至百萬 Token 視窗下的記憶體暴增與推論吞吐瓶頸。
⏳ 時間線
2026-08
阿里巴巴 Qwen 團隊正式釋出旗艦開源權重模型 Qwen3.8-2.4T-A95B
2026-09
AWS 於機器學習部落格發布在 SageMaker HyperPod (ml.p6-b300) 上部署 Qwen3.8-2.4T-A95B 的架構指南
📎 來源 (4)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog ↗
每週電子報
每週一封,可隨時退訂。