
自適應 RAG 壓縮降低邊緣運算能耗
這項研究提出由遙測資料驅動的執行期策略,動態調整邊緣 RAG 的檢索上下文壓縮程度。在 NVIDIA Jetson AGX Thor 上的實驗顯示,中度壓縮最多可降低 53.2% GPU 能耗及 48.2% SoC 能耗,同時幾乎不影響品質。
Tag: #context-compression6 results

這項研究提出由遙測資料驅動的執行期策略,動態調整邊緣 RAG 的檢索上下文壓縮程度。在 NVIDIA Jetson AGX Thor 上的實驗顯示,中度壓縮最多可降低 53.2% GPU 能耗及 48.2% SoC 能耗,同時幾乎不影響品質。
Llama 3.1 8B 使用結構化思考鏈和圖形上下文壓縮,在無微調情況下於多跳 QA 基準上匹配或超越 Llama 3.3 70B。檢索成功率達 77-91%,但推理是瓶頸。在 HotpotQA、MuSiQue 和 2WikiMultiHopQA 上測試,Groq 上成本降低 12 倍。

Cursor 使用強化學習訓練其新 AI 模型 Composer 以實現自我摘要。此功能支援代理式編碼,適用於長時程任務,透過內部測試壓縮程式碼上下文。它提升了處理長時間編碼工作階段的效率。

LangChain 在 Deep Agents SDK (Python) 和 CLI 中新增工具,讓模型能在適當時機自主壓縮上下文視窗。此功能透過取代舊訊息,減少代理工作記憶體中的資訊量。
Qwen-Code 發布 v0.15.9-nightly 版本,修復 CLI 參數驗證、OpenAI 請求日誌記錄及 Mistral 內容過濾問題。新功能包括上下文溢出時的反應式壓縮、QWEN_HOME 環境變數支援,以及改善的斜線命令發現。同時增強 VSCode 訊息編輯 UI 及長對話處理。
Qwen-Code 預覽版 v0.15.10 包含 CLI 驗證、OpenAI 記錄及 Mistral 內容過濾的錯誤修復。新功能新增上下文溢出反應式壓縮,以及背景專案技能提取的 autoSkill。CLI 改進提升斜線命令發現與設定保留。