📄較早收集於 24h

SideQuest:模型驅動 KV 快取管理,用於長時程代理推理

SideQuest:模型驅動 KV 快取管理,用於長時程代理推理
PostLinkedIn
📄閱讀原文: ArXiv AI
#kv-cache#agentic-reasoning#memory-compressionsidequestsidequestlrmarxiv

💡長代理任務 KV 快取減 65%—模型驅動勝啟發式!

⚡ 30-Second TL;DR

有什麼變化

LRM 推理 token 有用性進行 KV 快取壓縮

為什麼重要

透過大幅降低記憶體使用,讓長時程代理推理如深度研究更高效。提升真實世界 LLM 代理的解碼效能,無準確度妥協。

下一步行動

下載 arXiv:2602.22603v1,在你的 LRM 代理中原型化 SideQuest 以節省記憶體。

誰應關注:Researchers & Academics

關鍵要點

  • LRM 推理 token 有用性進行 KV 快取壓縮
  • 平行輔助任務避免上下文汙染
  • 僅用 215 樣本訓練
  • 代理任務峰值 token 減少 65%
  • 優於啟發式壓縮技術

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • SideQuest論文於2026年2月26日提交至arXiv,作者為Sanjay Kariyappa[2]
  • 在FRAMES基準測試中,準確度僅下降最多2%,在BrowseComp基準測試中下降5%[3]
  • 相較無壓縮基準,SideQuest將峰值token利用率降低56-65%,KV快取記憶體讀取降低53-71%[3]
  • SideQuest允許模型選擇性清除KV快取片段,實現自我記憶垃圾回收[3]
📊 競品分析▸ Show
技術特點基準性能
SideQuest模型驅動KV壓縮,平行輔助任務峰值token減65%,準確降<5%[3]
Quest查詢感知稀疏性,Top-K頁載入自注意力加速7.03×,端到端2.23×[6]
kvpress基準啟發式如H2O、SnapKV,固定快取大小支援25+策略,推理基準評估[5]

🛠️ 技術深入

  • SideQuest將KV壓縮框架為平行輔助任務,使用觸發短語預置序列,以交叉熵損失訓練[3]
  • 評估使用16k和24k token預算,對比無壓縮基準及三種啟發式方法[3]
  • 訓練僅需215個樣本,專注於代理任務如多跳推理[2][3]

🔮 前景展望AI analysis grounded in cited sources

SideQuest將提升長上下文代理任務的商業可行性
透過65%記憶體降低與最小準確損失,使長時程AI代理在資源受限環境中更具擴展性[3]
模型驅動壓縮將取代部分啟發式KV方法
SideQuest在代理基準優於啟發式技術,顯示LRM自我管理潛力[2][3]

時間線

2026-02
SideQuest論文提交arXiv (v1)
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。