🟩較早收集於 10m

使用 Slurm 實現 NVIDIA GB200 NVL72 峰值效率

使用 Slurm 實現 NVIDIA GB200 NVL72 峰值效率
PostLinkedIn
🟩閱讀原文: NVIDIA Developer Blog

💡透過 Slurm 解鎖機架規模 GPU 的 exascale 效能—避免局部性陷阱(38字元)

⚡ 30-Second TL;DR

有什麼變化

NVLink 一致性延伸至整個機架

為什麼重要

使大型 AI 叢集達到理論峰值效能,對大規模訓練與推論至關重要。

下一步行動

為您的 GB200 NVL72 叢集配置 Slurm 區塊排程以強制機架局部性。

誰應關注:Developers & AI Engineers

關鍵要點

  • NVLink 一致性延伸至整個機架
  • 機架規模局部性避免效能下降
  • Slurm 區塊排程實現峰值效率

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • GB200 NVL72 透過第五代 NVLink Switch 系統,將 72 個 Blackwell GPU 連接為單一邏輯 GPU,總頻寬高達 130TB/s,這使得 Slurm 的拓撲感知排程對於減少機架間延遲至關重要。
  • Slurm 的 'Topology/Tree' 外掛程式與 'Select/Cons_tres' 資源分配機制,能確保工作負載被限制在單一 NVLink 網域內,從而避免跨機架傳輸導致的效能瓶頸。
  • 針對 GB200 NVL72 的最佳化排程策略,不僅關注 GPU 數量,還需考慮 NVSwitch 的層級結構,以確保訓練任務在大規模叢集中維持線性擴展性。
📊 競品分析▸ Show
特性NVIDIA GB200 NVL72AMD Instinct MI325X/MI350 叢集Intel Gaudi 3 叢集
互連技術第五代 NVLink (機架級)Infinity Fabric / ROCmEthernet (RoCE)
記憶體架構HBM3e (統一記憶體)HBM3eHBM3e
軟體生態CUDA / NCCL (高度優化)ROCm (開源生態)oneAPI (開放標準)
效能定位極致 AI 訓練與推論高性價比 AI 訓練高效能 AI 推論與訓練

🛠️ 技術深入

  • 架構組成:單一 NVL72 機架包含 36 個 Grace CPU 與 72 個 Blackwell GPU,透過 9 個 NVLink Switch Tray 進行全互連。
  • 一致性記憶體:利用 NVLink 實現機架內所有 GPU 記憶體的統一存取,減少資料搬移開銷。
  • Slurm 整合:透過 topology.conf 定義機架拓撲,並使用 sbatch --switches 參數強制要求工作負載在單一 NVLink 網域內執行。
  • 頻寬特性:每個 GPU 擁有 1.8TB/s 的雙向 NVLink 頻寬,機架總頻寬達到 130TB/s,是傳統 InfiniBand 叢集的數倍。

🔮 前景展望AI analysis grounded in cited sources

機架級排程將成為超大規模 AI 叢集的標準配置。
隨著 GPU 互連技術演進至機架規模,傳統基於節點的排程器已無法滿足對低延遲與高頻寬的需求。
Slurm 將進一步整合針對 Blackwell 架構的自動化拓撲感知功能。
為了降低複雜度,排程器必須自動識別硬體拓撲,以減少手動配置錯誤導致的效能損失。

時間線

2024-03
NVIDIA 於 GTC 2024 正式發表 Blackwell 架構與 GB200 NVL72 系統。
2025-01
NVIDIA 開始向主要雲端服務供應商交付首批 GB200 NVL72 系統。
2025-09
Slurm 社群發布針對大規模 GPU 叢集拓撲感知排程的增強功能更新。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog