📚最新收集於 0m

Pangu 在昇騰平台上的通訊最佳化

Pangu 在昇騰平台上的通訊最佳化
PostLinkedIn
📚閱讀原文: InfoQ中国

💡了解 Pangu 工作負載如何針對 Huawei 昇騰加速器進行通訊效能調校。

⚡ 30-Second TL;DR

有什麼變化

針對 Pangu 訓練工作負載進行通訊最佳化

為什麼重要

這些實務可協助在昇騰平台執行大模型的團隊找出通訊瓶頸,並提升加速器使用率。對於評估傳統 GPU 基礎設施替代方案的企業尤其具參考價值。

下一步行動

在昇騰平台上對 Pangu 的訓練與推理通訊路徑進行基準測試,以找出同步與資料傳輸瓶頸。

誰應關注:Developers & AI Engineers

關鍵要點

  • 針對 Pangu 訓練工作負載進行通訊最佳化
  • 調校昇騰平台上的推理效能
  • 探索 Huawei AI 基礎設施的平台親和性

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Pangu 模型採用了昇騰(Ascend)平台的 HCCL(Huawei Collective Communication Library)通訊庫,針對大規模分散式訓練中的 All-Reduce 操作進行了深度算子融合。
  • 透過昇騰處理器的多級記憶體架構,Pangu 實現了計算與通訊的重疊(Computation-Communication Overlap),顯著降低了訓練過程中的通訊等待時間。
  • 針對 Pangu 的 MoE(Mixture of Experts)架構,華為開發了專用的動態負載平衡演算法,以解決昇騰叢集在處理非均勻專家路由時的通訊瓶頸。
  • 昇騰平台引入了基於 RDMA 的高速互連技術,結合 Pangu 的通訊拓撲感知排程,優化了跨節點資料傳輸的頻寬利用率。
  • 在推理階段,Pangu 透過昇騰的算子自動調優工具(Auto-Tuning),針對特定模型結構進行了記憶體存取模式的優化,提升了單位功耗下的推理吞吐量。
📊 競品分析▸ Show
特性/平台Huawei Ascend + PanguNVIDIA H100 + GPTGoogle TPU v5p + Gemini
通訊架構HCCL (自研)NVLink/NVSwitchICI (Inter-Chip Interconnect)
軟體生態CANNCUDAJAX/XLA
訓練優化算子融合與拓撲感知軟硬體協同設計叢集級互連優化

🛠️ 技術深入

  • 採用 HCCL 進行多卡通訊優化,支援多級層次化通訊拓撲,減少跨節點通訊開銷。
  • 實作了基於昇騰算子庫(ACL)的自訂算子,針對 Pangu 的 Transformer 變體進行了 FlashAttention 的硬體加速實作。
  • 利用昇騰處理器的 Cube 與 Vector 單元進行混合精度計算,並透過通訊壓縮技術(如 FP8 量化傳輸)減少頻寬壓力。
  • 實作了針對昇騰叢集的動態排程策略,根據節點間的實際頻寬動態調整通訊分組(Communication Grouping)。

🔮 前景展望AI analysis grounded in cited sources

昇騰平台將在 2027 年前實現對超大規模 MoE 模型訓練的線性擴展。
隨著 HCCL 通訊庫對動態路由支援的增強,跨節點通訊瓶頸將進一步降低。
Pangu 模型將全面轉向基於昇騰原生算子庫的端到端自動化部署。
華為持續推動 CANN 生態的自動調優能力,將減少對人工手寫算子優化的依賴。

時間線

2021-04
華為正式發布 Pangu 大模型系列。
2022-08
昇騰 AI 基礎軟體平台 CANN 升級,強化對大模型分散式訓練的支援。
2023-07
Pangu 模型 3.0 版本發布,強調在昇騰平台上的工業級應用與訓練效能。
2024-09
華為發布針對昇騰 910 系列的通訊最佳化技術白皮書,揭露 Pangu 訓練加速細節。
2025-11
昇騰平台推出新一代叢集通訊架構,進一步提升 Pangu 模型在萬卡叢集下的訓練效率。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: InfoQ中国