🟩較早收集於 20m

NVIDIA Blackwell 在 MLPerf Training 6.0 基準測試中取得領先地位

NVIDIA Blackwell 在 MLPerf Training 6.0 基準測試中取得領先地位
PostLinkedIn
🟩閱讀原文: NVIDIA Developer Blog
#gpu#benchmarks#ai-infrastructurenvidia-blackwellnvidiablackwellmlperf

💡了解 NVIDIA Blackwell 架構如何為大規模 AI 模型訓練樹立新的效能標竿。

⚡ 30-Second TL;DR

有什麼變化

Blackwell 在 MLPerf Training v6.0 中實現了最快的規模化訓練時間。

為什麼重要

這些結果鞏固了 Blackwell 作為大規模 AI 模型訓練首選硬體的地位。從業者可以預期在處理大型語言模型工作負載時,將獲得更高的吞吐量與更短的訓練時間。

下一步行動

評估您目前的訓練管線吞吐量與 Blackwell 公布的 MLPerf 指標,以判斷硬體遷移是否能優化您的模型開發生命週期。

誰應關注:Developers & AI Engineers

關鍵要點

  • Blackwell 在 MLPerf Training v6.0 中實現了最快的規模化訓練時間。
  • NVIDIA 在所有基準測試中均提供了最高的單加速器效能。
  • NVIDIA 是唯一針對測試套件中每一項測試皆提交結果的平台供應商。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 19 個來源。

🔑 增強重點摘要

  • NVIDIA Blackwell 平台在 MLPerf Training v5.1 首次亮相時,已在大型語言模型預訓練和微調方面展現顯著飛躍,並採用了 NVFP4 訓練方法以提升效能。
  • 在 MLPerf Training v6.0 中,NVIDIA 在多個雲端資料中心部署了多達 8,192 個 Blackwell GPU 協同運作,證明了該平台在實際環境中的穩健性及強大的擴展趨勢。
  • Blackwell 平台是唯一針對 MLPerf Training v6.0 中新增基準測試提交結果的供應商,其中包括 DeepSeek-V3(一個擁有 6710 億參數的專家混合模型)和 GPT-OSS-20B。
  • Blackwell Ultra GPU,特別是 GB300 NVL72 系統,在使用相同數量 GPU 的情況下,其 Llama 3.1 405B 預訓練效能比前一代 Hopper 架構提升超過 4 倍,Llama 2 70B LoRA 微調效能提升近 5 倍。

🛠️ 技術深入

  • Blackwell 架構 GPU(例如 B200)包含 2080 億個電晶體,採用客製化的台積電 4NP 製程製造。
  • 所有 Blackwell 產品均採用兩個受光罩限制的晶片,透過 10 TB/s 的晶片對晶片互連技術連接,形成一個統一的單一 GPU。
  • 第二代 Transformer Engine 結合了客製化的 Blackwell Tensor Core 技術與 NVIDIA TensorRT-LLM 和 NeMo 框架創新,以加速大型語言模型 (LLM) 和專家混合 (MoE) 模型的推論和訓練。
  • Blackwell Tensor Cores 引入了新的精度,包括社群定義的 MXFP6 和 MXFP4 微縮放格式,實現 4 位元浮點 (FP4) AI,以優化效能和準確性。
  • NVIDIA GB200 Grace Blackwell 超級晶片透過 900 GB/s 的超低功耗 NVLink-C2C 互連技術,將兩個 B200 Tensor Core GPU 連接到一個 NVIDIA Grace CPU。
  • GB200 NVL72 系統在液冷機架中整合了 36 個 Grace CPU 和 72 個 Blackwell GPU,形成一個具有 130 TB/s GPU 頻寬的 72 個 GPU NVLink 網域,可作為一個巨大的單一 GPU 運作。
  • 第五代 NVLink 提供 1.8 TB/s 的 GPU 對 GPU 互連頻寬。
  • Blackwell 包含專用的可靠性、可用性和可維護性 (RAS) 引擎,用於故障識別,以及解壓縮引擎以加速資料庫查詢。

🔮 前景展望AI analysis grounded in cited sources

NVIDIA 在 MLPerf Training 中持續領先,將鞏固其在大型 AI 基礎設施市場的主導地位。
持續刷新效能紀錄,並作為唯一針對新型複雜基準測試(如 MoE 模型)提交全面結果的供應商,顯示 NVIDIA 在硬體和軟體整合方面具有強大的競爭優勢,適用於尖端 AI 應用。
Blackwell 的 FP4 精度和先進 Transformer Engine 的廣泛採用將加速更高效大型語言模型的開發和部署。
Blackwell 專為低精度訓練 (FP4) 和 MoE 模型設計的架構增強功能,將實現更快的訓練時間和更低的下一代 AI 營運成本,從而推動產業採用。
機架級 GB200 NVL72 系統的效能將推動資料中心解決方案朝向整合式液冷設計發展,以實現百億億次級 AI 運算。
GB200 NVL72 能夠作為一個擁有 72 個互連 GPU 和液冷系統的巨大單一 GPU 運作,解決了萬億參數模型在擴展和功耗效率方面的挑戰,促使資料中心設計朝向更整合、高密度的解決方案發展。

時間線

2024-03-18
NVIDIA 在 GTC 2024 大會上正式發布 Blackwell 平台。
2024-Q4
Blackwell 資料中心產品推出。
2025-04-15
NVIDIA 發布 GeForce RTX 50 系列(Blackwell 架構)消費級 GPU。
2025-11-12
NVIDIA Blackwell Ultra 在 MLPerf Training v5.1 中首次亮相並創下紀錄。
2026-04-01
NVIDIA Blackwell Ultra GPU 在 MLPerf Inference v6.0 中實現最高效能提交。
2026-06-16
NVIDIA Blackwell 在 MLPerf Training v6.0 中取得全面勝利。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。