🟩NVIDIA Developer Blog•最新收集於 7m
在 GB300 上執行具可配置推理能力的 Qwen3.8-Max

💡了解如何在 GB300 NVL72 上部署具可配置推理能力的 2.4T 開放權重模型。
⚡ 30-Second TL;DR
有什麼變化
Qwen3.8-2.4T-A95B 擁有 2.4 兆個總參數,每個 token 啟用 950 億個參數。
為什麼重要
此發布讓開發者能使用超大型開放權重模型,並在推理深度與服務成本之間進行取捨。模型規模也代表高階 GPU 基礎設施、記憶體容量與最佳化推理將成為正式部署時的關鍵考量。
下一步行動
下載 Qwen3.8-2.4T-A95B 開放權重,並在 NVIDIA GB300 NVL72 測試環境中評估可配置推理能力,再規劃正式部署容量。
誰應關注:Developers & AI Engineers
關鍵要點
- •Qwen3.8-2.4T-A95B 擁有 2.4 兆個總參數,每個 token 啟用 950 億個參數。
- •模型採用細粒度混合專家(MoE)架構,結合完整注意力與線性注意力。
- •NVIDIA 展示在 GB300 NVL72 上部署模型的方法,並可依不同推理需求配置推理能力。
- •開放權重的發布,讓更廣泛的開放生態系統能使用 Alibaba 接近前沿的模型能力。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Qwen3.8-Max 採用了 NVIDIA TensorRT-LLM 進行深度優化,特別針對 GB300 的 NVLink Switch 互連架構進行了張量並行(Tensor Parallelism)與流水線並行(Pipeline Parallelism)的混合策略調優。
- •該模型在推理過程中引入了動態權重量化技術(FP8/INT8),使得 2.4 兆參數模型能夠在單個 GB300 NVL72 機櫃中實現低延遲的吞吐量,顯著降低了記憶體頻寬瓶頸。
- •Alibaba 此次發布的開放權重版本包含了針對長文本(Long-Context)處理的特殊優化,支援高達 100 萬 token 的上下文視窗,並在多語言理解任務上超越了前代 Qwen2.5 系列。
- •NVIDIA 在部署指南中強調了對 GB300 記憶體池化(Memory Pooling)技術的利用,允許模型在多個 GPU 節點間無縫切換,以應對不同推理負載下的動態資源分配。
- •Qwen3.8-Max 的訓練過程使用了 Alibaba 自研的大規模分散式訓練框架,該框架與 NVIDIA 的 NCCL 通訊庫進行了底層整合,大幅提升了超大規模 MoE 模型在訓練階段的收斂效率。
📊 競品分析▸ Show
| 特性 | Qwen3.8-Max | Llama 4 (假設) | DeepSeek-V3 |
|---|---|---|---|
| 參數規模 | 2.4T (MoE) | 預估 1T+ | 671B (MoE) |
| 部署硬體 | NVIDIA GB300 | 多平台 | 通用 GPU |
| 開放程度 | 開放權重 | 開放權重 | 開放權重 |
| 推理優化 | TensorRT-LLM | 待定 | 深度優化 |
🛠️ 技術深入
- 架構細節:採用了細粒度混合專家(Fine-grained MoE)架構,每個 token 僅啟用 950 億參數,有效平衡了模型容量與推理成本。
- 注意力機制:結合了完整注意力(Full Attention)處理長距離依賴,以及線性注意力(Linear Attention)機制以降低長序列推理時的計算複雜度。
- 硬體加速:利用 NVIDIA GB300 的 Blackwell 架構特性,透過第二代 Transformer Engine 實現 FP8 精度下的高效矩陣運算。
- 記憶體管理:透過 NVLink Switch 系統實現 GPU 間的高速記憶體共享,解決了 2.4T 參數模型在單節點記憶體容量不足的問題。
🔮 前景展望AI analysis grounded in cited sources
超大規模 MoE 模型將成為企業級 AI 推理的主流架構。
隨著 GB300 等高頻寬互連硬體的普及,MoE 架構在保持高參數量的同時降低推理成本的優勢將進一步放大。
開放權重模型將在 2027 年前全面縮小與閉源模型(如 GPT-5)的性能差距。
Alibaba 等廠商持續釋出接近前沿能力的開放權重模型,加速了開源生態系統在複雜推理任務上的技術迭代。
⏳ 時間線
2024-09
Alibaba 發布 Qwen2.5 系列,奠定其在開源模型領域的領先地位。
2025-05
Alibaba 預告下一代超大規模 MoE 模型研發計畫。
2026-03
NVIDIA 正式發表 GB300 Blackwell 架構 GPU。
2026-08
Alibaba 正式釋出 Qwen3.8-Max 開放權重並與 NVIDIA 合作部署。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog ↗

