📄較早收集於 21h

代理記憶11倍令牌縮減

代理記憶11倍令牌縮減
PostLinkedIn
📄閱讀原文: ArXiv AI

💡代理記憶11倍壓縮,保留96%召回—開源程式碼現已發布!

⚡ 30-Second TL;DR

有什麼變化

將交換壓縮成4個欄位:exchange_core、specific_context、thematic room_assignments、files_touched。

為什麼重要

以1/11成本在令牌限制內擴展長期代理互動,適合生產個人化AI。維持軟體工程用例高檢索率,同時允許逐字深入。

下一步行動

從arXiv下載開源蒸餾管線,並在您的代理對話記錄上測試。

誰應關注:Researchers & Academics

關鍵要點

  • 將交換壓縮成4個欄位:exchange_core、specific_context、thematic room_assignments、files_touched。
  • 6個軟體專案14,340交換實現11倍縮減(371至38令牌)。
  • 最佳蒸餾配置達逐字MRR 96%(0.717 vs 0.745);跨層達0.759。
  • 開源程式碼與分析管線發布以供複製。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • MemSifter使用代理模型與強化學習優化記憶檢索,將長時記憶輸入減至2000令牌,避免完整脈絡50秒處理延遲[6][7]
  • TRIM-KV透過輕量保留閘門學習每個令牌重要性,動態驅逐低分令牌以維持記憶預算內最高效KV快取[1]
  • LLMLingua提示壓縮與語意快取結合,可消除重複查詢LLM呼叫,特別適用於RAG系統長脈絡優化[5]
  • 需求分頁與工具存根修剪在SWE-bench代理中實現23–54%令牌減量,總計語料規模21.8%輸入節省[4]

🛠️ 技術深入

  • 結構化蒸餾未直接匹配,但相關TRIM-KV使用輕量神經網路輸入令牌嵌入產生衰減保留分數,按層與頭動態排序驅逐[1]
  • MemSifter預過濾超過128k令牌歷史,使用嵌入模型計算查詢與會話相似度,保留候選全內容後交由0.6B代理模型處理[6]
  • 需求分頁技術結合工具存根修剪、技能去重與靜態重送,投影857會話語料970.4M令牌節省,佔輸入21.8%[4]

🔮 前景展望AI analysis grounded in cited sources

代理記憶壓縮將標準化於多租戶AI平台,提升SLO保證下KV快取利用率
多租戶系統將令牌池視為可排程資源,優先機制結合服務等級與負債確保過載時保護高優先工作負載[3]
硬體協同設計將支援動態令牌稀疏,提升PIM架構下記憶頻寬效率
未來加速器模組將原生支援即時重要性評分與稀疏資料管線,減少動態修剪資料移動成本[2]
語意記憶壓縮將維持長視野效能,達ACON與階層抽象50%峰值令牌減量
互補策略如階層記憶卸載至檢索儲存與混合遮罩,動態調整脈絡視窗基於推理複雜度[2]

📎 來源 (9)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. arXiv — 2512
  2. arXiv — 2505
  3. arXiv — 2603
  4. arXiv — 2603
  5. redis.io — LLM Token Optimization Speed Up Apps
  6. arXiv — 2603
  7. youtube.com — Watch
  8. arXiv — 2603
  9. arXiv — 2601
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。