🔥PyTorch Blog•較早收集於 25m
FlexAttention 新增 FlashAttention-4 後端

#gpu-backend#cute-dslpytorchpytorchflexattentionflashattention-4hopperblackwell
💡PyTorch FlexAttention 更新帶來 Blackwell GPU 上自訂注意力計算速度提升 2 倍。(48 字元)
⚡ 30-Second TL;DR
有什麼變化
FlexAttention 在 Hopper/Blackwell GPU 上獲得 FlashAttention-4 後端
為什麼重要
這提升了在 NVIDIA 最新 GPU 上 transformer 模型訓練/推論的效率,降低 LLM 的記憶體使用與計算時間。AI 從業人員現在能更容易擴展更大模型並使用自訂注意力模式。
下一步行動
安裝 PyTorch nightly 並在 Hopper GPU 上基準測試 FlexAttention 搭配 FlashAttention-4。
誰應關注:Developers & AI Engineers
關鍵要點
- •FlexAttention 在 Hopper/Blackwell GPU 上獲得 FlashAttention-4 後端
- •PyTorch 自動生成 CuTeDSL 分數/遮罩修改函數
- •JIT 實例化自訂 FlashAttention-4 核心
- •提升注意力機制的速度與靈活性
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 8 個來源。
🔑 增強重點摘要
- •FlashAttention-4 採用 warp-specialized 5-stage pipeline,在 Blackwell GPU 上實現比 FlashAttention-3 更高的管線重疊與晶片內重用[1][2]。
- •FA4 透過 CUDA 核心執行軟體 exp2() 多項式近似,取代 SFU 進行 softmax 計算,避免瓶頸並提升並行性[1][2]。
- •FA4 引入自適應線上重縮放機制,僅在最大值變化足夠影響數值穩定性時重縮放,減少約 10 倍重縮放操作[1][2]。
- •FlashAttention-4 在 Blackwell 上比 cuDNN 注意力核心快約 20%,並支援分頁 KV 快取與 attention sinks[2][5]。
🛠️ 技術深入
- •FA4 使用高度管線化排程,將注意力計算分解為多組並行階段,由專門 warp group 處理不同責任,提升延遲隱藏與 GPU 資源利用率[1][2]。
- •softmax 優化包括軟體 exp2() 立方多項式近似(在 CUDA 核心執行)與智慧重縮放(僅當 m 變化超過閾值時更新)[1][2]。
- •內部以 CTA(cooperative thread array)為單位處理 Q/K/V 磚塊,支援 Tensor Memory 中的 tP/tO 更新,並整合非同步生產者-消費者管線[2]。
- •針對 Blackwell SM100 架構設計,支援低精度版本、分頁 KV 張量與 attention sinks,用於長上下文處理[5]。
- •頭維度支援至 256,後向傳播需 A100/H100 等高階 GPU,記憶體使用線性於序列長度,提供 10-20X 節省[3]。
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2023-07
FlashAttention-2 發佈,提升 Ampere/Hopper GPU 效能與記憶體效率
2024-01
PyTorch 引入 FlexAttention API,支援自訂注意力機制媲美 FlashAttention-2
2024-08
FlashAttention-3 針對 Hopper GPU 優化,引入進階管線與 softmax 改進
2025-08
FlashAttention-4 在 Hot Chips 初步展示,針對 Blackwell 達 20% 加速
2025-10
FlashAttention-4 原始碼釋出,支援 CUDA 12.8 與 H100/H800
2026-03
PyTorch FlexAttention 整合 FlashAttention-4 後端,支援 Hopper/Blackwell
📎 來源 (8)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: PyTorch Blog ↗
每週 AI 簡報
每週一封,可隨時退訂。