🦙Reddit r/LocalLLaMA•較早收集於 3h
FlashAttention-4:在Blackwell上達1613 TFLOPs/s
#gpu-kernel#inference-speed#python-dslflashattention-4flashattention-4vllmtritonblackwellh100
💡Attention 核心在 Blackwell 上匹配 matmul 速度—對快速推理影響巨大 (28字)
⚡ 30-Second TL;DR
有什麼變化
B200 上 BF16 前向達 1613 TFLOPs/s (71% 使用率)
為什麼重要
大幅提升新 NVIDIA GPU 上的推理速度,使 attention 快如 matmul。在 B200/H100 上實現更快本地 LLM 服務。Python kernel 解鎖開發者快速迭代。
下一步行動
更新至 vLLM 0.17.0,並在 B200 上測試自動 FlashAttention-4 效能。
誰應關注:Developers & AI Engineers
關鍵要點
- •B200 上 BF16 前向達 1613 TFLOPs/s (71% 使用率)
- •比 Triton 快 2.1-2.7 倍,比 cuDNN 9.13 快 1.3 倍
- •vLLM 0.17.0 在 B200 自動啟用;支持 Llama、Mistral
- •僅 Hopper/Blackwell;Python CuTe-DSL 2.5 秒編譯
🧠 深度解析
本篇為 AI 生成分析,非原文內容。
🔑 增強重點摘要
- •FlashAttention-4 引入了針對 Blackwell 架構的全新記憶體存取排程策略,特別優化了對片上 SRAM 的頻寬利用率,以解決 Blackwell 龐大算力與記憶體頻寬之間的瓶頸。
- •該版本採用了全新的編譯器後端技術,將 CuTe-DSL 的編譯時間大幅縮短至 2.5 秒,解決了以往 FlashAttention 版本在複雜模型架構下編譯時間過長的問題。
- •除了效能提升,FlashAttention-4 在 Blackwell 上實現了更精細的算子融合(Operator Fusion),減少了中間結果寫入 HBM 的次數,顯著降低了長序列推理時的延遲。
📊 競品分析▸ Show
| 特性 | FlashAttention-4 | Triton (OpenAI) | cuDNN (NVIDIA) |
|---|---|---|---|
| 架構優化 | 針對 Blackwell 深度優化 | 通用型 GPU 編程框架 | 針對 NVIDIA 硬體標準化庫 |
| 效能 (B200) | 1613 TFLOPs/s (BF16) | 較慢 (約 600-760 TFLOPs/s) | 較慢 (約 1240 TFLOPs/s) |
| 靈活性 | 高 (CuTe-DSL) | 極高 (Python 語法) | 低 (封裝好的 API) |
| 編譯時間 | 2.5 秒 | 即時編譯 | 預編譯/靜態連結 |
🛠️ 技術深入
- CuTe-DSL 應用:利用 CuTe 庫進行底層記憶體佈局管理,直接操作 Tensor 的 Layout 與 Tile 劃分,避開了傳統 CUDA C++ 繁瑣的同步機制。
- SRAM 緩存策略:針對 Blackwell 的 SM 架構,優化了 Shared Memory 的 Bank Conflict,確保在執行 GQA/MQA 時的讀寫吞吐量最大化。
- 算子融合技術:將 Softmax 與 Dropout 運算與矩陣乘法(GEMM)深度融合,減少了記憶體存取(Memory Access)的開銷。
- 硬體對齊:專門利用 Blackwell 的 Tensor Core 數據路徑,針對 BF16 數據格式進行了指令級的流水線優化。
🔮 前景展望AI analysis grounded in cited sources
FlashAttention-4 將成為 Blackwell 伺服器推理的標準配置。
其在 B200 上顯著的效能優勢與 vLLM 的原生整合,將迫使企業級推理框架放棄舊版算子以追求極致吞吐量。
CuTe-DSL 將加速非 NVIDIA 陣營的算子開發。
FlashAttention-4 的成功證明了 Python 驅動的底層 DSL 可以達到接近手寫 CUDA 的效能,這將推動其他硬體廠商跟進類似的編程模型。
⏳ 時間線
2022-05
FlashAttention 論文發表,引入 IO 感知注意力機制。
2023-07
FlashAttention-2 發布,優化了並行化策略與工作負載分配。
2024-09
FlashAttention-3 發布,針對 Hopper 架構進行了顯著的效能提升。
2026-03
FlashAttention-4 發布,針對 Blackwell 架構實現 1613 TFLOPs/s 效能。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。