🦙較早收集於 3h

FlashAttention-4:在Blackwell上達1613 TFLOPs/s

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#gpu-kernel#inference-speed#python-dslflashattention-4flashattention-4vllmtritonblackwellh100

💡Attention 核心在 Blackwell 上匹配 matmul 速度—對快速推理影響巨大 (28字)

⚡ 30-Second TL;DR

有什麼變化

B200 上 BF16 前向達 1613 TFLOPs/s (71% 使用率)

為什麼重要

大幅提升新 NVIDIA GPU 上的推理速度,使 attention 快如 matmul。在 B200/H100 上實現更快本地 LLM 服務。Python kernel 解鎖開發者快速迭代。

下一步行動

更新至 vLLM 0.17.0,並在 B200 上測試自動 FlashAttention-4 效能。

誰應關注:Developers & AI Engineers

關鍵要點

  • B200 上 BF16 前向達 1613 TFLOPs/s (71% 使用率)
  • 比 Triton 快 2.1-2.7 倍,比 cuDNN 9.13 快 1.3 倍
  • vLLM 0.17.0 在 B200 自動啟用;支持 Llama、Mistral
  • 僅 Hopper/Blackwell;Python CuTe-DSL 2.5 秒編譯

🧠 深度解析

本篇為 AI 生成分析,非原文內容。

🔑 增強重點摘要

  • FlashAttention-4 引入了針對 Blackwell 架構的全新記憶體存取排程策略,特別優化了對片上 SRAM 的頻寬利用率,以解決 Blackwell 龐大算力與記憶體頻寬之間的瓶頸。
  • 該版本採用了全新的編譯器後端技術,將 CuTe-DSL 的編譯時間大幅縮短至 2.5 秒,解決了以往 FlashAttention 版本在複雜模型架構下編譯時間過長的問題。
  • 除了效能提升,FlashAttention-4 在 Blackwell 上實現了更精細的算子融合(Operator Fusion),減少了中間結果寫入 HBM 的次數,顯著降低了長序列推理時的延遲。
📊 競品分析▸ Show
特性FlashAttention-4Triton (OpenAI)cuDNN (NVIDIA)
架構優化針對 Blackwell 深度優化通用型 GPU 編程框架針對 NVIDIA 硬體標準化庫
效能 (B200)1613 TFLOPs/s (BF16)較慢 (約 600-760 TFLOPs/s)較慢 (約 1240 TFLOPs/s)
靈活性高 (CuTe-DSL)極高 (Python 語法)低 (封裝好的 API)
編譯時間2.5 秒即時編譯預編譯/靜態連結

🛠️ 技術深入

  • CuTe-DSL 應用:利用 CuTe 庫進行底層記憶體佈局管理,直接操作 Tensor 的 Layout 與 Tile 劃分,避開了傳統 CUDA C++ 繁瑣的同步機制。
  • SRAM 緩存策略:針對 Blackwell 的 SM 架構,優化了 Shared Memory 的 Bank Conflict,確保在執行 GQA/MQA 時的讀寫吞吐量最大化。
  • 算子融合技術:將 Softmax 與 Dropout 運算與矩陣乘法(GEMM)深度融合,減少了記憶體存取(Memory Access)的開銷。
  • 硬體對齊:專門利用 Blackwell 的 Tensor Core 數據路徑,針對 BF16 數據格式進行了指令級的流水線優化。

🔮 前景展望AI analysis grounded in cited sources

FlashAttention-4 將成為 Blackwell 伺服器推理的標準配置。
其在 B200 上顯著的效能優勢與 vLLM 的原生整合,將迫使企業級推理框架放棄舊版算子以追求極致吞吐量。
CuTe-DSL 將加速非 NVIDIA 陣營的算子開發。
FlashAttention-4 的成功證明了 Python 驅動的底層 DSL 可以達到接近手寫 CUDA 的效能,這將推動其他硬體廠商跟進類似的編程模型。

時間線

2022-05
FlashAttention 論文發表,引入 IO 感知注意力機制。
2023-07
FlashAttention-2 發布,優化了並行化策略與工作負載分配。
2024-09
FlashAttention-3 發布,針對 Hopper 架構進行了顯著的效能提升。
2026-03
FlashAttention-4 發布,針對 Blackwell 架構實現 1613 TFLOPs/s 效能。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。