Search

直接匹配不多,已補上最新動態。

Tag: #tiling1 results

AMD GPU 自製分塊注意力機制

AMD GPU 自製分塊注意力機制

一位使用者為不受支援的 AMD MI50 GPU(gfx906)開發 PyTorch 基於分塊注意力的 flash-attention 替代方案,避免視訊生成時 OOM。受 llama.cpp 啟發,使用查詢分塊、softmax 後備機制,以及 BF16 轉 FP16 等優化。純 PyTorch,無需自訂核心。

Reddit r/LocalLLaMACommunityMar 28#flash-attention#amd-gpu#tiling