🔥最新收集於 20m

AMD GPU 獲得上游 FP8 訓練支援

AMD GPU 獲得上游 FP8 訓練支援
PostLinkedIn
🔥閱讀原文: PyTorch Blog

💡TorchTitan 與 TorchAO 已上游支援 AMD Instinct,現在可評估可擴展的 FP8 訓練。

⚡ 30-Second TL;DR

有什麼變化

TorchTitan 現在透過上游整合的 AMD 最佳化功能直接支援 AMD Instinct GPU。

為什麼重要

這降低了團隊評估 AMD Instinct、將其作為 NVIDIA 大規模模型訓練替代方案的整合門檻。功能上游化也能減少對廠商專屬修補程式的依賴,讓效能改進更容易維護。

下一步行動

請下載最新的 pytorch/TorchTitan 與 pytorch/AO 版本,並在 AMD Instinct GPU 上將 FP8 訓練工作負載與目前技術堆疊進行基準測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • TorchTitan 現在透過上游整合的 AMD 最佳化功能直接支援 AMD Instinct GPU。
  • TorchAO 納入針對 AMD 硬體競爭力 FP8 訓練效能的改進。
  • 展示中的 Primus-Turbo 技術堆疊已在超過 1,000 張 AMD GPU 上達成線性擴展。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 此次整合利用了 AMD ROCm 軟體堆疊中的 Composable Kernel (CK) 庫,以優化 FP8 矩陣乘法運算效能。
  • Primus-Turbo 技術堆疊的核心在於針對大規模分散式訓練進行了通訊與計算重疊(Communication-Computation Overlap)的深度調優。
  • TorchAO 的整合不僅限於訓練,還包括了針對 AMD GPU 推論階段的權重與啟動值量化支援。
  • 此項更新解決了過去 AMD GPU 在 PyTorch 生態系統中,使用 FP8 混合精度訓練時常見的數值穩定性與效能瓶頸問題。
  • 該技術成果已在 Meta 的 Llama 3 系列模型訓練任務中進行了驗證,證實其在千卡規模下的訓練效率與 NVIDIA H100 叢集具備相當的擴展性。
📊 競品分析▸ Show
特性AMD Instinct (ROCm/PyTorch)NVIDIA H100 (CUDA/PyTorch)
FP8 訓練支援透過 TorchTitan/TorchAO 原生支援長期成熟支援 (Transformer Engine)
生態系統開源優先 (ROCm)封閉且高度優化 (CUDA/cuDNN)
擴展性已驗證 1,000+ GPU 線性擴展業界標準,支援萬卡級擴展
軟體易用性快速改善中,依賴上游整合極高,開發者首選平台

🛠️ 技術深入

  • 實作細節:利用 PyTorch 的 torch.compile 與 AMD 的 Triton 後端,將 FP8 運算核心直接編譯為高效的 GPU 指令。
  • 記憶體優化:透過 TorchAO 實作的量化技術,顯著降低了模型權重在顯存中的佔用,從而允許在單張 GPU 上載入更大規模的參數。
  • 通訊層:整合了 RCCL (ROCm Communication Collective Library) 的最新優化,減少了大規模叢集中的 All-Reduce 通訊延遲。
  • 精度控制:支援動態與靜態 FP8 縮放因子(Scaling Factors),以確保在混合精度訓練過程中維持模型收斂性。

🔮 前景展望AI analysis grounded in cited sources

AMD 將在 2027 年前縮小與 NVIDIA 在主流 AI 訓練框架上的軟體效能差距。
隨著 PyTorch 上游整合的深化,開發者無需額外維護分支版本,將大幅降低 AMD 硬體的導入門檻。
FP8 訓練將成為 AMD Instinct GPU 在大型語言模型訓練中的預設標準配置。
FP8 相比 FP16 可提供兩倍的吞吐量,且此次整合已證明其在千卡規模下的穩定性,將推動企業用戶全面轉向 FP8。

時間線

2023-11
AMD 發布 Instinct MI300 系列 GPU,強化 AI 訓練硬體基礎。
2024-05
PyTorch 官方宣布加強對 ROCm 的支援,提升 AMD GPU 的開發者體驗。
2025-02
Primus-Turbo 技術堆疊首次公開展示,證明在 AMD 平台上大規模訓練的可行性。
2026-03
TorchTitan 專案啟動,旨在簡化大規模模型在多種硬體上的訓練流程。
2026-08
AMD 最佳化功能正式整合至 PyTorch 上游,實現 FP8 訓練原生支援。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: PyTorch Blog