Search

Tag: #gpu-memory14 results

從第一原理解釋 FlashAttention

從第一原理解釋 FlashAttention

一篇部落格文章從第一原理拆解 FlashAttention,解釋它如何透過核心融合、tiling、重計算和 online softmax 最小化 GPU 記憶體資料移動來優化標準 attention。此 IO 感知方法實現更快的訓練、更長的上下文和更低的記憶體使用量。文章建立直覺,說明傳統 attention 為何緩慢且記憶體受限。

Reddit r/LocalLLaMACommunityMar 27#gpu-memory#kernel-fusion
Page 1 of 2