🤖最新收集於 57m

用滑動視窗注意力縮減 LLM KV 快取

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning
#kv-cache#long-contextswaswaqwen2.5-7bhugging-facegithub

💡了解 SWA 如何將 Qwen2.5-7B 的 KV 記憶體從數 GB 降至約 3.5 MB。

⚡ 30-Second TL;DR

有什麼變化

提供可重複使用的推理層,支援預訓練 Hugging Face 因果式 LLM,無需修改模型或重新訓練。

為什麼重要

SWA 可能大幅降低長 context 生成的記憶體成本,讓受限硬體上的推理更可行。開發者仍需在檢索、摘要與多輪對話任務上驗證品質,因為有界視窗會刻意丟棄大部分較早的 KV 狀態。

下一步行動

請複製 SWA 儲存庫,並在目標 Hugging Face 模型上以長 context 檢索和多輪對話測試比較 SWA-64 與 Full Attention。

誰應關注:Developers & AI Engineers

關鍵要點

  • 提供可重複使用的推理層,支援預訓練 Hugging Face 因果式 LLM,無需修改模型或重新訓練。
  • 透過 attention sinks、近期滑動視窗、有界 KV 快取,以及循環/環形緩衝區管理儲存空間。
  • 在 Qwen2.5-7B 測試中,16K、32K 與 64K context 的 KV 快取記憶體皆維持約 3.5 MB;完整注意力則約為 923 MB、1.84 GB,並在 64K OOM。
  • 在 16K context 下,SWA-64 將 TPOT 從約 38.4 ms 降至 30.5 ms,但擷取遠距資訊的能力可能下降。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。