🟩較早收集於 13m

利用 NVIDIA Blackwell 的 NVFP4 加速 LLM 訓練

利用 NVIDIA Blackwell 的 NVFP4 加速 LLM 訓練
PostLinkedIn
🟩閱讀原文: NVIDIA Developer Blog

💡了解 Blackwell 硬體上的 NVFP4 如何大幅縮短 LLM 訓練時間並降低基礎設施成本。

⚡ 30-Second TL;DR

有什麼變化

為 Blackwell GPU 引入 NVFP4 數值精度格式

為什麼重要

此更新透過提升硬體效率,顯著降低了訓練超大規模模型的門檻。它使研究人員能夠在兆級 token 的數據集上實現更快的迭代週期。

下一步行動

查閱最新的 MaxText 文件,將 NVFP4 整合到您基於 JAX 的 Blackwell 硬體訓練管線中。

誰應關注:Developers & AI Engineers

關鍵要點

  • 為 Blackwell GPU 引入 NVFP4 數值精度格式
  • 優化大規模 frontier LLM 預訓練的吞吐量
  • 縮短處理海量 token 的訓練時間並降低運算成本
  • 解決低位元混合精度訓練流程中的複雜性

🧠 深度解析

Web-grounded analysis with 20 cited sources.

🔑 增強重點摘要

  • NVFP4採用兩級縮放策略和16個值為一組的微區塊縮放,這對於在4位元精度下保持模型準確性至關重要,有效解決了動態範圍和異常值的挑戰。
  • NVFP4顯著減少了模型記憶體佔用,相對於FP16減少約3.5倍,相對於FP8減少約1.8倍,這使得單一GPU能夠容納更大規模的模型或批次大小。
  • Blackwell架構的第五代Tensor Cores對NVFP4操作提供原生硬體加速,特別是透過其Transformer Engine,實現了顯著的吞吐量提升,例如推論速度比INT4模型快2.35倍,GPT-3預訓練速度比Hopper快2倍。
  • NVFP4訓練已證明對於大型模型(例如在10兆個token上訓練的120億參數模型)能達到與FP8基準模型幾乎相同的準確性,甚至在推論時能與BF16媲美,有效改善了效率與準確性之間的權衡。

🛠️ 技術深入

  • NVFP4是一種4位元浮點格式(E2M1),包含1個符號位元、2個指數位元和1個尾數位元,可表示約-6到6之間的值。
  • 它採用兩級縮放策略:一個細粒度的FP8(E4M3)縮放因子,在16個值的微區塊中共享;以及一個應用於整個張量的第二級FP32標量。這種微區塊縮放(從MXFP4的32個元素減少)透過更局部地適應資料的動態範圍,最大限度地減少了量化誤差。
  • Blackwell的第五代Tensor Cores原生加速FP4/FP8數學運算,大幅提高了算術密度,並支援FP16、FP8和FP4之間的混合精度執行。
  • NVFP4儲存一個4位元值,加上少量開銷(每16個值一個FP8縮放因子,以及每個張量一個FP32第二級縮放因子),平均每個值約4.5位元。
  • Blackwell Transformer Engine利用微張量縮放等細粒度縮放技術,優化4位元浮點(FP4)AI的效能和準確性。
  • 並非所有張量都進行量化;通常只有Transformer區塊內線性運算子的權重和激活值會轉換為FP4。

🔮 前景展望AI analysis grounded in cited sources

NVFP4將加速LLM訓練的普及化,降低進入門檻。
透過顯著降低記憶體需求和運算成本,NVFP4使更多研究人員和企業能夠訓練更大規模的模型,而無需龐大的硬體投資。
未來LLM架構將進一步優化以充分利用4位元精度格式。
隨著NVFP4證明4位元訓練的可行性,模型設計者將探索更適合超低精度運算的架構和演算法,以最大化效能和準確性。
NVIDIA將鞏固其在AI加速硬體市場的領導地位,特別是在大規模LLM訓練領域。
Blackwell架構對NVFP4的原生硬體支援及其在MLPerf基準測試中的顯著效能提升,將使其成為需要高效能LLM訓練的組織的首選。

時間線

2020-05
NVIDIA A100 Tensor Core GPU推出,引入BF16精度,加速AI運算。
2022-09
NVIDIA Hopper架構H100 Tensor Core GPU推出,支援FP8精度,進一步提升LLM訓練效能。
2024-03
NVIDIA Blackwell平台於GTC 2024正式發布,引入NVFP4等新精度格式。
2024-11
NVIDIA Blackwell平台在MLPerf Training v4.1基準測試中首次提交結果,展示LLM訓練效能比Hopper提升2倍。
2025-08
NVIDIA發布NVFP4訓練指南,強調其在4位元精度下實現與FP8相當的準確性。
2025-10
研究顯示NVFP4能夠以4位元精度訓練120億參數模型,並達到與8位元FP8模型幾乎相同的準確度。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog