🟩較早收集於 15m

利用先進融合核心提升 MoE 訓練吞吐量

利用先進融合核心提升 MoE 訓練吞吐量
PostLinkedIn
🟩閱讀原文: NVIDIA Developer Blog
#gpu-optimization#deep-learningnvidia-moe-fusion-kernelsnvidiamoe

💡了解如何利用 NVIDIA 最新的核心優化技術,顯著提升您的 MoE 模型訓練速度。

⚡ 30-Second TL;DR

有什麼變化

優化 MoE 模型以處理更大的容量,同時保持稀疏參數激活。

為什麼重要

這些優化使研究人員能夠在現有的運算預算內訓練規模更大的模型。它直接解決了 GPU 叢集上稀疏模型訓練的瓶頸問題。

下一步行動

查看最新的 NVIDIA Developer Blog 程式碼範例,將這些融合核心整合到您的自訂 MoE 訓練管線中。

誰應關注:Developers & AI Engineers

關鍵要點

  • 優化 MoE 模型以處理更大的容量,同時保持稀疏參數激活。
  • 利用先進的融合核心來減少大規模訓練中的開銷。
  • 提升超越傳統密集架構模型的可擴展性與吞吐量。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 28 個來源。

🔑 增強重點摘要

  • MoE 模型在預訓練期間能比同等品質的密集模型更快達到相同效能,這意味著在相同的計算預算下,可以大幅擴展模型或資料集的大小。
  • NVIDIA 的 Blackwell 架構,特別是 GB200 NVL72 系統,為 MoE 模型帶來了顯著的性能飛躍(例如,相較於 H200 提升 10 倍),並將每個 token 的成本降低了 10 倍以上,從而改變了大規模 AI 的經濟效益。
  • 融合核心透過將 MoE 層的多個邏輯步驟(如門控評分、top-k 選擇、路由、專家計算和結果組合)合併到單一 GPU 核心啟動中,有效解決了核心啟動和 GPU 全域記憶體與計算單元之間資料移動所產生的開銷。
  • MoE 訓練面臨的挑戰包括路由的不可微分性、專家負載不平衡、通訊開銷和記憶體碎片化,這些問題需要透過輔助平衡損失、可微分近似和先進記憶體管理技術等解決方案來克服。
  • NVIDIA 的軟體堆疊,包括 TensorRT-LLM 和 Megatron Core,在 MoE 優化中扮演關鍵角色,提供 FP8/FP4 支援、程式化依賴啟動 (PDL) 和優化通訊原語等功能。

🛠️ 技術深入

  • 融合核心 (Fusion Kernels):將 MoE 層中的多個邏輯操作(例如計算門控分數、選擇 Top-K 專家、路由 token、執行專家計算和組合結果)合併為單一 GPU 核心啟動。這能顯著減少核心啟動開銷和 GPU 全域記憶體與計算單元之間的資料移動。
  • 稀疏圖融合模組 (Sparse Graph Fusion Module, SGFM):一種架構建構,用於統一異構稀疏圖操作(如 SDDMM、softmax 歸一化和 SpMM),以提高計算效率、減少記憶體佔用並改善資料局部性。
  • NVIDIA 硬體架構
    • Hopper (H100/H200):配備第四代 Tensor Cores 和 Transformer Engine,可針對大型語言模型動態調整精度(支援 FP8/FP16),並透過 NVLink 實現多 GPU 高速互連。
    • Blackwell (B100/B200/GB200 NVL72):引入 NVFP4 精度(4 位元浮點格式),第五代 NVLink 提供高達 1,800 GB/s 的雙向頻寬,支援分離式服務(將預填充和解碼操作分配到不同 GPU),並透過 TensorRT-LLM 中的程式化依賴啟動 (PDL) 和核心優化來加速稀疏 MoE 模型。
  • MoE 模型架構:用稀疏 MoE 層取代傳統的密集前饋網路 (FFN) 層。一個門控網路會為每個 token 選擇 K 個專家,每個專家通常是一個獨立的前饋神經網路。
  • MoE 訓練挑戰與解決方案
    • 路由不可微分性:採用軟性、可微分的近似方法或基於強化學習的路由機制。
    • 專家負載不平衡:引入輔助平衡損失(例如來自 Switch Transformer 的方法)或在反向傳播中加入負載平衡梯度。
    • 記憶體碎片化:透過自動監控和混合記憶體優化技術(如梯度檢查點)來解決。
    • 通訊開銷:利用高速互連(如 NVLink、NVSwitch)和優化的通訊函式庫(如 NCCL),並將通訊與計算重疊。
  • 軟體優化
    • NVIDIA TensorRT-LLM:為 Blackwell 架構提供增強功能,包括 PDL 和核心優化,以提高 MoE 模型的推論吞吐量。
    • NVIDIA Megatron Core:一個用於大規模 MoE 模型訓練的框架,支援批次級別的通訊重疊、FP8 精度和路由器融合核心。
    • Triton:可用於編寫自定義融合核心,實現記憶體節省並支援不同 GPU 平台。
    • Q-Sparse:一種無需訓練的稀疏激活 LLM 方法,透過 Top-K 稀疏化和直通估計器實現激活的完全稀疏性,提高推論效率。
    • TEAL:一種無需訓練的 LLM 激活稀疏化技術,透過將小幅度激活裁剪為零來實現模型範圍的稀疏性,從而提高解碼速度。

🔮 前景展望AI analysis grounded in cited sources

MoE 模型,特別是結合 NVIDIA 優化技術的 MoE 模型,將成為大規模 AI(尤其是大型語言模型)的主導架構。
顯著的性能和成本效益提升(例如,每個 token 的成本降低 10 倍)使得訓練和部署萬億級參數模型在經濟上可行且具備可擴展性。
硬體與軟體協同設計對於最大化 AI 模型性能將變得越來越關鍵。
NVIDIA 在 Blackwell 及其軟體堆疊(TensorRT-LLM、Megatron Core)上的成功表明,緊密整合的硬體和軟體優化對於釋放 MoE 等先進架構的全部潛力至關重要。
對稀疏激活和高效核心執行的關注將從 MoE 擴展到其他大型 AI 模型。
Q-Sparse 和 TEAL 等無需訓練的激活稀疏化技術的出現,顯示出透過選擇性地停用神經元來優化所有大型模型(不僅限於 MoE)的計算和記憶體的廣泛趨勢。

時間線

1991-00
Robert Jacobs 和 Geoffrey Hinton 發表「局部專家自適應混合 (Adaptive Mixtures of Local Experts)」,奠定 MoE 概念基礎。
2015-00
Google 的 Shazeer 等人透過「極其龐大的神經網路 (Outrageously Large Neural Networks)」中的稀疏門控 MoE,重新啟動 MoE 研究,實現深度學習中的稀疏專家激活。
2021-08
Microsoft DeepSpeed MoE 實現了在 512 個 A100 GPU 上訓練 3.5 萬億參數模型的能力,展示了大規模 MoE 的潛力。
2022-03
NVIDIA 推出 Hopper 架構 (H100 GPU),配備 Transformer Engine,旨在加速大型語言模型的訓練和推論。
2025-09
NVIDIA Megatron Core 引入 MoE 模型的路由器融合核心和 FP8 精度支援。
2025-12
NVIDIA Blackwell 架構 (GB200 NVL72) 針對 MoE 模型展現出比 H200 高 10 倍的性能飛躍,並將每個 token 的成本降低 10 倍以上。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。