📄較早收集於 40m

SGDR 透過動態技能檢索提升網頁代理效能

SGDR 透過動態技能檢索提升網頁代理效能
PostLinkedIn
📄閱讀原文: ArXiv AI

💡了解動態、具備狀態感知能力的技能檢索如何將您的網頁代理成功率提升超過 10%。

⚡ 30-Second TL;DR

有什麼變化

引入滑動視窗提取流程,將執行軌跡轉換為可重複使用的子程序。

為什麼重要

這項研究為多步驟網頁自動化提供了更強大的框架,使代理能夠處理靜態模型通常無法完成的複雜、狀態依賴型任務。

下一步行動

查看 SGDR 的 GitHub 儲存庫,將其動態檢索機制整合到您自己的網頁自動化代理中。

誰應關注:Researchers & Academics

關鍵要點

  • 引入滑動視窗提取流程,將執行軌跡轉換為可重複使用的子程序。
  • 利用雙重文字-程式碼表示法,連結技能檢索與可執行動作。
  • 將技能與任務指令及即時網頁狀態進行配對,以提高適應性。
  • 在 WebArena 基準測試中,使用 GPT-4.1 的效能較基準模型提升了 10.6%。

🧠 深度解析

Web-grounded analysis with 20 cited sources.

🔑 增強重點摘要

  • SGDR解決了「靜態技能檢索」的限制,這是一個在代理式人工智慧中公認的瓶頸,因為固定的技能集難以適應動態的網頁環境和多步驟推理,導致效能下降。
  • SGDR的「雙重文字-程式碼表示法」是一個關鍵的技術細節,它彌合了用於技能檢索的自然語言理解與可執行動作之間的鴻溝,這是開發強健網頁代理的常見挑戰。
  • SGDR的「滑動視窗提取流程」能夠從執行軌跡中建立可重複使用的子程序,促進線上技能學習,並實現步驟級、狀態條件式的技能檢索,這比傳統的任務級技能重複使用更具適應性。
  • SGDR使用GPT-4.1進行基準測試的結果值得關注,因為GPT-4.1是OpenAI於2025年4月發布的模型,專為編碼、指令遵循和長上下文理解而優化,非常適合複雜的網頁自動化任務。
  • SGDR在WebArena基準測試中的表現尤其重要,因為WebArena是一個高度真實且可重現的環境,它評估代理在多樣化、多步驟網頁任務中的功能正確性,反映了真實世界網頁自動化所面臨的挑戰。
📊 競品分析▸ Show
Feature/AspectSGDRWebXSkillSkillFlowAgentic RAG/SRA (通用概念)STITCHSkillWeaver
核心機制狀態接地動態檢索、滑動視窗提取、雙重文字-程式碼表示法可執行技能(參數化動作程式+自然語言指導)、URL圖形組織多階段檢索管道(密集檢索、淺層重排序、深度重排序、最終選擇)動態檢索、多步驟推理、適應性恢復、工具協調結構化意圖追蹤、上下文意圖索引自主探索、技能實踐、技能合成
技能檢索層級步驟級、狀態條件式步驟級任務級(從大型庫中檢索)多步驟、迭代上下文意圖匹配探索與合成
技能表示雙重文字-程式碼參數化動作程式+自然語言指導SKILL.md 文件可執行能力結構化檢索線索、上下文意圖可重複使用的API (Python函數)
主要優勢根據即時網頁狀態動態檢索,提高適應性彌合文本與程式碼間的接地鴻溝,實現直接執行與代理適應從大型技能庫中高效檢索相關技能克服靜態RAG的限制,處理複雜多步驟任務降低長程互動中的檢索噪音,支援意圖感知記憶透過自主探索和實踐實現自我改進和技能泛化
基準測試WebArena (GPT-4.1 37.5%, Qwen3-4B 24.3%)WebArena (提升9.8點), WebVoyager (提升12.9點)SkillsBench (Pass@1 從9.2%提升至16.4%)HotpotQA (89% vs 34% for static RAG)CAME-Bench, LongMemEval (超越最強基準35.6%)未提供具體數值,但強調自我改進

🛠️ 技術深入

  • 滑動視窗提取流程:將已完成的執行軌跡轉換為可重複使用的子程序,這些子程序可在中間執行狀態下被調用,從而從較長的任務軌跡中提取出粒度適中的技能。
  • 雙重文字-程式碼表示法:每個技能都以自然語言描述和可執行程式碼對的形式呈現。自然語言描述用於檢索,而可執行程式碼則提供實際的動作執行能力,彌合了理解與執行之間的鴻溝。
  • 狀態接地動態檢索機制:根據任務目標和當前網頁狀態動態匹配技能。這意味著代理不僅考慮初始任務指令,還會根據網頁的即時變化來選擇最合適的技能,解決了靜態檢索的局限性。
  • 線上技能學習:代理能夠從先前的任務軌跡中持續地歸納技能,並在未來的任務中即時重複使用,實現了步驟級的技能重用。
  • WebArena 基準測試環境:SGDR在WebArena上進行評估,該環境包含來自電子商務、社交論壇、協作軟體開發和內容管理等五個真實網頁領域的任務,旨在測試代理在複雜、多步驟瀏覽器任務中的能力。

🔮 前景展望AI analysis grounded in cited sources

網頁代理將能更自主地處理複雜且動態的線上任務。
SGDR透過動態技能檢索和狀態感知能力,使代理能夠適應不斷變化的網頁環境,從而減少人工干預並擴展其應用範圍。
技能學習和檢索將成為開發高效能AI代理的關鍵瓶頸之一。
隨著技能庫的擴大,如何有效且準確地檢索和整合相關技能,同時避免「技能載入幻覺」等問題,將是未來研究和開發的重點。
未來的AI代理將更廣泛地採用混合式技能表示法,結合自然語言描述與可執行程式碼。
SGDR的雙重文字-程式碼表示法有效彌合了理解與執行之間的差距,這種模式預計將被更多代理系統採納以提高魯棒性和適應性。

時間線

2023-07
WebArena基準測試環境首次發布,旨在提供一個真實且可重現的網頁環境,用於評估自主AI代理。
2024-11
WebArena-Verified開始與合作夥伴進行初步發布,收集早期反饋。
2025-04
OpenAI發布GPT-4.1模型,主要面向API開發者,在編碼、指令遵循和長上下文理解方面有顯著提升。
2025-05
GPT-4.1模型在ChatGPT中向所有付費用戶開放。
2025-12
WebArena-Verified公開發布,提供經過驗證的數據集和確定性評估工具。
2026-06
SGDR (State-Grounded Dynamic Retrieval) 研究論文在ArXiv上發表,提出透過動態技能檢索提升網頁代理效能的方法。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI