
重新思考 LLM Agent 基準測試:超越靜態排行榜
這項研究指出,目前針對 LLM Agent 的總分排行榜無法準確預測實際部署的效能。作者提出了一種基於預測效度與分佈外測試的新評估框架,以更精確地衡量 Agent 的能力。
Tag: #llm-agents89 results

這項研究指出,目前針對 LLM Agent 的總分排行榜無法準確預測實際部署的效能。作者提出了一種基於預測效度與分佈外測試的新評估框架,以更精確地衡量 Agent 的能力。

研究人員提出了一種基於提示詞的不確定性分解方法,使 LLM 代理能夠區分行動信心與任務模糊性。與 ReAct+UE 等現有方法相比,該方法在多個基準測試中顯著提升了釐清需求的表現。
研究人員發現了「驗證者稅」現象,即隨著任務複雜度增加,為工具使用型 LLM 代理實施安全檢查會降低任務完成率。該研究提出了一種雙層驗證架構,旨在平衡安全約束與操作成功率。

ToolSense 是一個新的開源診斷框架,用於評估大型語言模型 (LLM) 從大型目錄中檢索和理解工具的能力。研究揭示了「知識與檢索脫節」的現象,即模型在檢索基準測試中表現良好,但卻無法展現對工具的實際理解。

Evoflux 是一種推理時演化搜尋方法,旨在修復小型語言模型的工具執行工作流。透過結構化編輯與執行回饋來演化工作流圖,顯著提升了工具執行的可行性。

SkillJuror 是一個評估程序性知識組織方式如何影響 LLM Agent 行為的新框架。研究發現,與扁平化的技能結構相比,「漸進式揭露」(Progressive Disclosure)能顯著提升 Agent 的資源利用率與任務成功率。

研究人員提出了 ACTION-RATING,這是一種將尋求協助直接整合至代理行動空間的方法。此機制使代理能夠自主判斷何時需要澄清,從而顯著提升在複雜階層式任務中的導航準確度。

這項研究顯示,結合近期工具互動的選擇性保留與自動摘要,能顯著提升企業工作流程中 LLM 代理的效能。該方法在達到 91.6% 任務完成率的同時,相較於保留完整歷史紀錄,大幅降低了 Token 消耗與推論時間。

研究人員評估了八種記憶體系統在五種不同場景下的表現,發現當代理(Agent)能主動控制儲存與檢索時,表現最為優異。此洞察促成了 AutoMEM 的開發,這是一種利用自我管理工具介面來實現卓越跨場景通用性的記憶體框架。

AdaCoM 是一個新框架,透過訓練外部 LLM 來管理凍結代理(frozen agents)的上下文,進而提升網頁搜尋等長程任務的效能。它能透過修剪過時資訊並保留任務關鍵限制來優化上下文。