📄較早收集於 11h

透過高效上下文工程優化長程 LLM 代理

透過高效上下文工程優化長程 LLM 代理
PostLinkedIn
📄閱讀原文: ArXiv AI

💡學習如何透過選擇性上下文修剪,提升 LLM 代理可靠性並降低 60% 的推論成本。

⚡ 30-Second TL;DR

有什麼變化

保留完整上下文效率低落,在企業任務中會消耗過多 Token 與時間。

為什麼重要

這項研究為開發複雜企業系統自主代理的開發者提供了可擴展的藍圖。透過優化上下文視窗,團隊能降低營運成本並提升 AI 驅動的財務與營運任務之可靠性。

下一步行動

為您的代理工具使用歷史紀錄實作滑動視窗緩衝區並結合摘要層,以優化 Token 使用量與準確度。

誰應關注:Developers & AI Engineers

關鍵要點

  • 保留完整上下文效率低落,在企業任務中會消耗過多 Token 與時間。
  • 將上下文修剪至最近 5 次工具互動,可將任務完成率提升至 79.0%。
  • 結合修剪與自動摘要技術,能達到 91.6% 的最高完成率。
  • 此方法有效緩解了 Microsoft Dynamics 365 工作流程中的上下文溢出與狀態過時錯誤。

🧠 深度解析

Web-grounded analysis with 25 cited sources.

🔑 增強重點摘要

  • 大型語言模型(LLM)的上下文窗口限制不僅導致高昂的計算成本與延遲,還存在「迷失在中間」(lost-in-the-middle)的現象,即模型對長文本中間部分的注意力顯著下降,影響任務完成率與資訊召回率,這使得單純擴大上下文窗口並非萬能解決方案。
  • 上下文工程(Context Engineering)已從提示工程(Prompt Engineering)演變為一門系統性學科,旨在優化LLM輸入資訊的品質、結構與相關性,而非僅限於提示詞的措辭,這對於在生產環境中部署高效且穩定的企業級AI代理至關重要。
  • LLM代理的記憶系統超越了單純的上下文窗口,通常包含短期記憶(如上下文窗口、滑動窗口、摘要)和長期記憶(如向量資料庫),並可進一步細分為語意記憶、情節記憶和程序性記憶,以支援複雜的多步驟任務和跨會話知識累積。
  • 除了上下文修剪和摘要,NVIDIA的KVTC和Google的TurboQuant等先進技術透過壓縮鍵值快取(KV Cache),能大幅降低LLM在追蹤對話歷史時所需的記憶體用量達20倍,並顯著提升首個Token的生成速度,從而緩解長上下文帶來的記憶體瓶頸與成本問題。

🛠️ 技術深入

  • 上下文窗口限制與挑戰:Transformer架構中注意力機制的計算複雜度為O(N²),其中N為上下文長度,導致長上下文的計算成本和延遲呈指數級增長。此外,LLM存在「迷失在中間」問題,即對長上下文中間部分的資訊召回率顯著下降。
  • 記憶體管理策略
    • 短期記憶:主要透過上下文窗口、滑動窗口(保留最近N條互動)和訊息壓縮/摘要來管理,以適應LLM有限的上下文容量。
    • 長期記憶:通常依賴外部儲存系統,如向量資料庫,用於儲存用戶偏好、歷史任務經驗或外部知識,並透過檢索增強生成(RAG)等機制在需要時將相關資訊引入上下文。
    • 多層記憶架構:更複雜的代理系統會整合工作記憶(上下文窗口)、情節記憶(互動記錄)和語意記憶(事實知識),以實現更全面的狀態管理。
  • 自動摘要技術:透過LLM本身對歷史對話或工具互動進行壓縮,生成簡潔的摘要,以減少Token消耗,同時保留關鍵資訊。LangChain等框架提供了SummarizationNode等工具來實現此功能。
  • 鍵值快取(KV Cache)優化
    • KVTC (KV Cache Transform Coding):NVIDIA開發的技術,借鑒JPEG等媒體壓縮格式概念,壓縮多輪對話AI系統背後的KV快取,最高可達20倍壓縮率,且不需修改模型本身,將首Token生成時間加速最多8倍。
    • TurboQuant:Google Research推出的演算法,透過量化技術將KV快取資料從32位元浮點數壓縮至3-4位元整數表示,記憶體使用量減少5-6倍,並在NVIDIA H100 GPU上將注意力處理速度提升最高8倍,無需重新訓練。
  • 工具調用管理:代理系統透過上下文感知的狀態機來管理工具可用性,並可透過預填充(pre-filling)或直接掩碼Token的logits來約束動作選擇,確保代理在特定狀態下只從相關工具組中選擇。

🔮 前景展望AI analysis grounded in cited sources

上下文工程將成為企業級AI代理部署的標準實踐。
隨著企業對LLM代理在複雜工作流程中自主執行任務的需求增加,高效的上下文管理是解決成本、性能和可靠性挑戰的關鍵。
AI產業的競爭焦點將從單純的模型規模轉向完整的AI作業系統與基礎架構。
微軟等巨頭已明確指出,未來企業競爭力在於建立可治理、可擴展、可持續優化的AI代理平台,而非僅僅擁有最強大的模型。
LLM代理將能處理更長程、更複雜的企業任務,並具備更強的「記憶」能力。
結合選擇性保留、自動摘要、KV快取壓縮以及多層記憶系統的進步,代理將能克服上下文限制,實現跨會話的知識累積與長期規劃。

時間線

2020-05
GPT-3發布,其2K上下文窗口成為早期LLM的典型限制。
2023-06
Reddit討論顯示,即使2000個Token的上下文長度對某些應用實用,但業界已在追求更長上下文以處理複雜場景。
2025-08
Salesforce AI Research發布MCP-Universe基準測試,揭示即使最先進LLM在真實企業場景中任務成功率仍低,凸顯上下文管理與多步驟推理的挑戰。
2025-10
上下文工程被正式定義為超越提示工程的系統性方法論,旨在解決LLM在生產環境中的上下文問題。
2026-03
NVIDIA推出KVTC技術,大幅壓縮LLM的KV快取記憶體用量達20倍,提升長上下文推理效率。
2026-03
Google發布TurboQuant演算法,透過量化技術將LLM鍵值快取記憶體使用量減少5-6倍,無需重新訓練。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI