🤖Reddit r/MachineLearning•最新收集於 57m
用滑動視窗注意力縮減 LLM KV 快取
#kv-cache#long-contextswaswaqwen2.5-7bhugging-facegithub
💡了解 SWA 如何將 Qwen2.5-7B 的 KV 記憶體從數 GB 降至約 3.5 MB。
⚡ 30-Second TL;DR
有什麼變化
提供可重複使用的推理層,支援預訓練 Hugging Face 因果式 LLM,無需修改模型或重新訓練。
為什麼重要
SWA 可能大幅降低長 context 生成的記憶體成本,讓受限硬體上的推理更可行。開發者仍需在檢索、摘要與多輪對話任務上驗證品質,因為有界視窗會刻意丟棄大部分較早的 KV 狀態。
下一步行動
請複製 SWA 儲存庫,並在目標 Hugging Face 模型上以長 context 檢索和多輪對話測試比較 SWA-64 與 Full Attention。
誰應關注:Developers & AI Engineers
關鍵要點
- •提供可重複使用的推理層,支援預訓練 Hugging Face 因果式 LLM,無需修改模型或重新訓練。
- •透過 attention sinks、近期滑動視窗、有界 KV 快取,以及循環/環形緩衝區管理儲存空間。
- •在 Qwen2.5-7B 測試中,16K、32K 與 64K context 的 KV 快取記憶體皆維持約 3.5 MB;完整注意力則約為 923 MB、1.84 GB,並在 64K OOM。
- •在 16K context 下,SWA-64 將 TPOT 從約 38.4 ms 降至 30.5 ms,但擷取遠距資訊的能力可能下降。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週 AI 簡報
每週一封,可隨時退訂。