🟩最新收集於 7m

在 GB300 上執行具可配置推理能力的 Qwen3.8-Max

在 GB300 上執行具可配置推理能力的 Qwen3.8-Max
PostLinkedIn
🟩閱讀原文: NVIDIA Developer Blog

💡了解如何在 GB300 NVL72 上部署具可配置推理能力的 2.4T 開放權重模型。

⚡ 30-Second TL;DR

有什麼變化

Qwen3.8-2.4T-A95B 擁有 2.4 兆個總參數,每個 token 啟用 950 億個參數。

為什麼重要

此發布讓開發者能使用超大型開放權重模型,並在推理深度與服務成本之間進行取捨。模型規模也代表高階 GPU 基礎設施、記憶體容量與最佳化推理將成為正式部署時的關鍵考量。

下一步行動

下載 Qwen3.8-2.4T-A95B 開放權重,並在 NVIDIA GB300 NVL72 測試環境中評估可配置推理能力,再規劃正式部署容量。

誰應關注:Developers & AI Engineers

關鍵要點

  • Qwen3.8-2.4T-A95B 擁有 2.4 兆個總參數,每個 token 啟用 950 億個參數。
  • 模型採用細粒度混合專家(MoE)架構,結合完整注意力與線性注意力。
  • NVIDIA 展示在 GB300 NVL72 上部署模型的方法,並可依不同推理需求配置推理能力。
  • 開放權重的發布,讓更廣泛的開放生態系統能使用 Alibaba 接近前沿的模型能力。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Qwen3.8-Max 採用了 NVIDIA TensorRT-LLM 進行深度優化,特別針對 GB300 的 NVLink Switch 互連架構進行了張量並行(Tensor Parallelism)與流水線並行(Pipeline Parallelism)的混合策略調優。
  • 該模型在推理過程中引入了動態權重量化技術(FP8/INT8),使得 2.4 兆參數模型能夠在單個 GB300 NVL72 機櫃中實現低延遲的吞吐量,顯著降低了記憶體頻寬瓶頸。
  • Alibaba 此次發布的開放權重版本包含了針對長文本(Long-Context)處理的特殊優化,支援高達 100 萬 token 的上下文視窗,並在多語言理解任務上超越了前代 Qwen2.5 系列。
  • NVIDIA 在部署指南中強調了對 GB300 記憶體池化(Memory Pooling)技術的利用,允許模型在多個 GPU 節點間無縫切換,以應對不同推理負載下的動態資源分配。
  • Qwen3.8-Max 的訓練過程使用了 Alibaba 自研的大規模分散式訓練框架,該框架與 NVIDIA 的 NCCL 通訊庫進行了底層整合,大幅提升了超大規模 MoE 模型在訓練階段的收斂效率。
📊 競品分析▸ Show
特性Qwen3.8-MaxLlama 4 (假設)DeepSeek-V3
參數規模2.4T (MoE)預估 1T+671B (MoE)
部署硬體NVIDIA GB300多平台通用 GPU
開放程度開放權重開放權重開放權重
推理優化TensorRT-LLM待定深度優化

🛠️ 技術深入

  • 架構細節:採用了細粒度混合專家(Fine-grained MoE)架構,每個 token 僅啟用 950 億參數,有效平衡了模型容量與推理成本。
  • 注意力機制:結合了完整注意力(Full Attention)處理長距離依賴,以及線性注意力(Linear Attention)機制以降低長序列推理時的計算複雜度。
  • 硬體加速:利用 NVIDIA GB300 的 Blackwell 架構特性,透過第二代 Transformer Engine 實現 FP8 精度下的高效矩陣運算。
  • 記憶體管理:透過 NVLink Switch 系統實現 GPU 間的高速記憶體共享,解決了 2.4T 參數模型在單節點記憶體容量不足的問題。

🔮 前景展望AI analysis grounded in cited sources

超大規模 MoE 模型將成為企業級 AI 推理的主流架構。
隨著 GB300 等高頻寬互連硬體的普及,MoE 架構在保持高參數量的同時降低推理成本的優勢將進一步放大。
開放權重模型將在 2027 年前全面縮小與閉源模型(如 GPT-5)的性能差距。
Alibaba 等廠商持續釋出接近前沿能力的開放權重模型,加速了開源生態系統在複雜推理任務上的技術迭代。

時間線

2024-09
Alibaba 發布 Qwen2.5 系列,奠定其在開源模型領域的領先地位。
2025-05
Alibaba 預告下一代超大規模 MoE 模型研發計畫。
2026-03
NVIDIA 正式發表 GB300 Blackwell 架構 GPU。
2026-08
Alibaba 正式釋出 Qwen3.8-Max 開放權重並與 NVIDIA 合作部署。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog

Run Qwen3.8-Max on GB300 with Configurable Reasoning | NVIDIA Developer Blog | SetupAI | SetupAI