🟩NVIDIA Developer Blog•較早收集於 20m
NVIDIA Blackwell 在 MLPerf Training 6.0 基準測試中取得領先地位

💡了解 NVIDIA Blackwell 架構如何為大規模 AI 模型訓練樹立新的效能標竿。
⚡ 30-Second TL;DR
有什麼變化
Blackwell 在 MLPerf Training v6.0 中實現了最快的規模化訓練時間。
為什麼重要
這些結果鞏固了 Blackwell 作為大規模 AI 模型訓練首選硬體的地位。從業者可以預期在處理大型語言模型工作負載時,將獲得更高的吞吐量與更短的訓練時間。
下一步行動
評估您目前的訓練管線吞吐量與 Blackwell 公布的 MLPerf 指標,以判斷硬體遷移是否能優化您的模型開發生命週期。
誰應關注:Developers & AI Engineers
關鍵要點
- •Blackwell 在 MLPerf Training v6.0 中實現了最快的規模化訓練時間。
- •NVIDIA 在所有基準測試中均提供了最高的單加速器效能。
- •NVIDIA 是唯一針對測試套件中每一項測試皆提交結果的平台供應商。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 19 個來源。
🔑 增強重點摘要
- •NVIDIA Blackwell 平台在 MLPerf Training v5.1 首次亮相時,已在大型語言模型預訓練和微調方面展現顯著飛躍,並採用了 NVFP4 訓練方法以提升效能。
- •在 MLPerf Training v6.0 中,NVIDIA 在多個雲端資料中心部署了多達 8,192 個 Blackwell GPU 協同運作,證明了該平台在實際環境中的穩健性及強大的擴展趨勢。
- •Blackwell 平台是唯一針對 MLPerf Training v6.0 中新增基準測試提交結果的供應商,其中包括 DeepSeek-V3(一個擁有 6710 億參數的專家混合模型)和 GPT-OSS-20B。
- •Blackwell Ultra GPU,特別是 GB300 NVL72 系統,在使用相同數量 GPU 的情況下,其 Llama 3.1 405B 預訓練效能比前一代 Hopper 架構提升超過 4 倍,Llama 2 70B LoRA 微調效能提升近 5 倍。
🛠️ 技術深入
- Blackwell 架構 GPU(例如 B200)包含 2080 億個電晶體,採用客製化的台積電 4NP 製程製造。
- 所有 Blackwell 產品均採用兩個受光罩限制的晶片,透過 10 TB/s 的晶片對晶片互連技術連接,形成一個統一的單一 GPU。
- 第二代 Transformer Engine 結合了客製化的 Blackwell Tensor Core 技術與 NVIDIA TensorRT-LLM 和 NeMo 框架創新,以加速大型語言模型 (LLM) 和專家混合 (MoE) 模型的推論和訓練。
- Blackwell Tensor Cores 引入了新的精度,包括社群定義的 MXFP6 和 MXFP4 微縮放格式,實現 4 位元浮點 (FP4) AI,以優化效能和準確性。
- NVIDIA GB200 Grace Blackwell 超級晶片透過 900 GB/s 的超低功耗 NVLink-C2C 互連技術,將兩個 B200 Tensor Core GPU 連接到一個 NVIDIA Grace CPU。
- GB200 NVL72 系統在液冷機架中整合了 36 個 Grace CPU 和 72 個 Blackwell GPU,形成一個具有 130 TB/s GPU 頻寬的 72 個 GPU NVLink 網域,可作為一個巨大的單一 GPU 運作。
- 第五代 NVLink 提供 1.8 TB/s 的 GPU 對 GPU 互連頻寬。
- Blackwell 包含專用的可靠性、可用性和可維護性 (RAS) 引擎,用於故障識別,以及解壓縮引擎以加速資料庫查詢。
🔮 前景展望AI analysis grounded in cited sources
NVIDIA 在 MLPerf Training 中持續領先,將鞏固其在大型 AI 基礎設施市場的主導地位。
持續刷新效能紀錄,並作為唯一針對新型複雜基準測試(如 MoE 模型)提交全面結果的供應商,顯示 NVIDIA 在硬體和軟體整合方面具有強大的競爭優勢,適用於尖端 AI 應用。
Blackwell 的 FP4 精度和先進 Transformer Engine 的廣泛採用將加速更高效大型語言模型的開發和部署。
Blackwell 專為低精度訓練 (FP4) 和 MoE 模型設計的架構增強功能,將實現更快的訓練時間和更低的下一代 AI 營運成本,從而推動產業採用。
機架級 GB200 NVL72 系統的效能將推動資料中心解決方案朝向整合式液冷設計發展,以實現百億億次級 AI 運算。
GB200 NVL72 能夠作為一個擁有 72 個互連 GPU 和液冷系統的巨大單一 GPU 運作,解決了萬億參數模型在擴展和功耗效率方面的挑戰,促使資料中心設計朝向更整合、高密度的解決方案發展。
⏳ 時間線
2024-03-18
NVIDIA 在 GTC 2024 大會上正式發布 Blackwell 平台。
2024-Q4
Blackwell 資料中心產品推出。
2025-04-15
NVIDIA 發布 GeForce RTX 50 系列(Blackwell 架構)消費級 GPU。
2025-11-12
NVIDIA Blackwell Ultra 在 MLPerf Training v5.1 中首次亮相並創下紀錄。
2026-04-01
NVIDIA Blackwell Ultra GPU 在 MLPerf Inference v6.0 中實現最高效能提交。
2026-06-16
NVIDIA Blackwell 在 MLPerf Training v6.0 中取得全面勝利。
📎 來源 (19)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog ↗
每週 AI 簡報
每週一封,可隨時退訂。

