📚InfoQ中国•最新收集於 0m
Pangu 在昇騰平台上的通訊最佳化

💡了解 Pangu 工作負載如何針對 Huawei 昇騰加速器進行通訊效能調校。
⚡ 30-Second TL;DR
有什麼變化
針對 Pangu 訓練工作負載進行通訊最佳化
為什麼重要
這些實務可協助在昇騰平台執行大模型的團隊找出通訊瓶頸,並提升加速器使用率。對於評估傳統 GPU 基礎設施替代方案的企業尤其具參考價值。
下一步行動
在昇騰平台上對 Pangu 的訓練與推理通訊路徑進行基準測試,以找出同步與資料傳輸瓶頸。
誰應關注:Developers & AI Engineers
關鍵要點
- •針對 Pangu 訓練工作負載進行通訊最佳化
- •調校昇騰平台上的推理效能
- •探索 Huawei AI 基礎設施的平台親和性
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Pangu 模型採用了昇騰(Ascend)平台的 HCCL(Huawei Collective Communication Library)通訊庫,針對大規模分散式訓練中的 All-Reduce 操作進行了深度算子融合。
- •透過昇騰處理器的多級記憶體架構,Pangu 實現了計算與通訊的重疊(Computation-Communication Overlap),顯著降低了訓練過程中的通訊等待時間。
- •針對 Pangu 的 MoE(Mixture of Experts)架構,華為開發了專用的動態負載平衡演算法,以解決昇騰叢集在處理非均勻專家路由時的通訊瓶頸。
- •昇騰平台引入了基於 RDMA 的高速互連技術,結合 Pangu 的通訊拓撲感知排程,優化了跨節點資料傳輸的頻寬利用率。
- •在推理階段,Pangu 透過昇騰的算子自動調優工具(Auto-Tuning),針對特定模型結構進行了記憶體存取模式的優化,提升了單位功耗下的推理吞吐量。
📊 競品分析▸ Show
| 特性/平台 | Huawei Ascend + Pangu | NVIDIA H100 + GPT | Google TPU v5p + Gemini |
|---|---|---|---|
| 通訊架構 | HCCL (自研) | NVLink/NVSwitch | ICI (Inter-Chip Interconnect) |
| 軟體生態 | CANN | CUDA | JAX/XLA |
| 訓練優化 | 算子融合與拓撲感知 | 軟硬體協同設計 | 叢集級互連優化 |
🛠️ 技術深入
- 採用 HCCL 進行多卡通訊優化,支援多級層次化通訊拓撲,減少跨節點通訊開銷。
- 實作了基於昇騰算子庫(ACL)的自訂算子,針對 Pangu 的 Transformer 變體進行了 FlashAttention 的硬體加速實作。
- 利用昇騰處理器的 Cube 與 Vector 單元進行混合精度計算,並透過通訊壓縮技術(如 FP8 量化傳輸)減少頻寬壓力。
- 實作了針對昇騰叢集的動態排程策略,根據節點間的實際頻寬動態調整通訊分組(Communication Grouping)。
🔮 前景展望AI analysis grounded in cited sources
昇騰平台將在 2027 年前實現對超大規模 MoE 模型訓練的線性擴展。
隨著 HCCL 通訊庫對動態路由支援的增強,跨節點通訊瓶頸將進一步降低。
Pangu 模型將全面轉向基於昇騰原生算子庫的端到端自動化部署。
華為持續推動 CANN 生態的自動調優能力,將減少對人工手寫算子優化的依賴。
⏳ 時間線
2021-04
華為正式發布 Pangu 大模型系列。
2022-08
昇騰 AI 基礎軟體平台 CANN 升級,強化對大模型分散式訓練的支援。
2023-07
Pangu 模型 3.0 版本發布,強調在昇騰平台上的工業級應用與訓練效能。
2024-09
華為發布針對昇騰 910 系列的通訊最佳化技術白皮書,揭露 Pangu 訓練加速細節。
2025-11
昇騰平台推出新一代叢集通訊架構,進一步提升 Pangu 模型在萬卡叢集下的訓練效率。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: InfoQ中国 ↗



