🔥較早收集於 25m

FlexAttention 新增 FlashAttention-4 後端

FlexAttention 新增 FlashAttention-4 後端
PostLinkedIn
🔥閱讀原文: PyTorch Blog
#gpu-backend#cute-dslpytorchpytorchflexattentionflashattention-4hopperblackwell

💡PyTorch FlexAttention 更新帶來 Blackwell GPU 上自訂注意力計算速度提升 2 倍。(48 字元)

⚡ 30-Second TL;DR

有什麼變化

FlexAttention 在 Hopper/Blackwell GPU 上獲得 FlashAttention-4 後端

為什麼重要

這提升了在 NVIDIA 最新 GPU 上 transformer 模型訓練/推論的效率,降低 LLM 的記憶體使用與計算時間。AI 從業人員現在能更容易擴展更大模型並使用自訂注意力模式。

下一步行動

安裝 PyTorch nightly 並在 Hopper GPU 上基準測試 FlexAttention 搭配 FlashAttention-4。

誰應關注:Developers & AI Engineers

關鍵要點

  • FlexAttention 在 Hopper/Blackwell GPU 上獲得 FlashAttention-4 後端
  • PyTorch 自動生成 CuTeDSL 分數/遮罩修改函數
  • JIT 實例化自訂 FlashAttention-4 核心
  • 提升注意力機制的速度與靈活性

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • FlashAttention-4 採用 warp-specialized 5-stage pipeline,在 Blackwell GPU 上實現比 FlashAttention-3 更高的管線重疊與晶片內重用[1][2]
  • FA4 透過 CUDA 核心執行軟體 exp2() 多項式近似,取代 SFU 進行 softmax 計算,避免瓶頸並提升並行性[1][2]
  • FA4 引入自適應線上重縮放機制,僅在最大值變化足夠影響數值穩定性時重縮放,減少約 10 倍重縮放操作[1][2]
  • FlashAttention-4 在 Blackwell 上比 cuDNN 注意力核心快約 20%,並支援分頁 KV 快取與 attention sinks[2][5]

🛠️ 技術深入

  • FA4 使用高度管線化排程,將注意力計算分解為多組並行階段,由專門 warp group 處理不同責任,提升延遲隱藏與 GPU 資源利用率[1][2]
  • softmax 優化包括軟體 exp2() 立方多項式近似(在 CUDA 核心執行)與智慧重縮放(僅當 m 變化超過閾值時更新)[1][2]
  • 內部以 CTA(cooperative thread array)為單位處理 Q/K/V 磚塊,支援 Tensor Memory 中的 tP/tO 更新,並整合非同步生產者-消費者管線[2]
  • 針對 Blackwell SM100 架構設計,支援低精度版本、分頁 KV 張量與 attention sinks,用於長上下文處理[5]
  • 頭維度支援至 256,後向傳播需 A100/H100 等高階 GPU,記憶體使用線性於序列長度,提供 10-20X 節省[3]

🔮 前景展望AI analysis grounded in cited sources

FlashAttention-4 將成為 Blackwell GPU 上 LLM 推論標準後端
其 20% 速度提升與記憶體效率優化 cuDNN,使 PyTorch FlexAttention 更具競爭力於生產部署[2]
FlexAttention 的 CuTeDSL 自動生成將加速自訂注意力研究
自動產生分數/遮罩修改函數降低開發門檻,JIT 支援自訂配置提升靈活性與效能[文章][1]
Hopper/Blackwell 生態將見注意力計算 15-20X 整體加速
結合管線優化與軟體數學函數,FA4 在 H100/Blackwell 上大幅超越前代與 PyTorch 原生注意力[3][5]

時間線

2023-07
FlashAttention-2 發佈,提升 Ampere/Hopper GPU 效能與記憶體效率
2024-01
PyTorch 引入 FlexAttention API,支援自訂注意力機制媲美 FlashAttention-2
2024-08
FlashAttention-3 針對 Hopper GPU 優化,引入進階管線與 softmax 改進
2025-08
FlashAttention-4 在 Hot Chips 初步展示,針對 Blackwell 達 20% 加速
2025-10
FlashAttention-4 原始碼釋出,支援 CUDA 12.8 與 H100/H800
2026-03
PyTorch FlexAttention 整合 FlashAttention-4 後端,支援 Hopper/Blackwell
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: PyTorch Blog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。