
PExA 在 Spider 2.0 達 70.2% SOTA
PExA 將 text-to-SQL 重新表述為軟體測試覆蓋率,使用平行原子 SQL 測試案例確保語義覆蓋。僅在探索足夠資訊後生成最終 SQL,解決 LLM 代理的延遲-效能權衡問題。在 Spider 2.0 基準測試中達成 70.2% 執行準確率新 SOTA。
Tag: #llm-agents89 results

PExA 將 text-to-SQL 重新表述為軟體測試覆蓋率,使用平行原子 SQL 測試案例確保語義覆蓋。僅在探索足夠資訊後生成最終 SQL,解決 LLM 代理的延遲-效能權衡問題。在 Spider 2.0 基準測試中達成 70.2% 執行準確率新 SOTA。

研究人員提出子目標驅動框架與 MiRA RL 方法,解決 LLM 代理在網頁導航的長時程規劃問題。MiRA 將 Gemma3-12B 在 WebArena-Lite 的成功率從 6.4% 提升至 43%,超越 GPT-4-Turbo (17.6%) 與 GPT-4o (13.9%)。此規劃與里程碑獎勵組合提升自主 AI 能力。
研究人員推出 GAP 基準測試,評估 LLM 代理中文字層級安全與工具呼叫安全的差異。測試六款前沿模型橫跨六大領域,發現文字拒絕並未阻止有害工具呼叫,即使在安全強化提示下仍有 219 例持續發生。本研究呼籲需專門針對工具呼叫安全進行評估與緩解。

研究人員推出了 GRACE,這是一種將代理指令維護為類型化語義圖的方法,以防止長週期任務中的驗證問題。透過在局部圖鄰域內驗證更新,該方法在可靠性方面顯著優於傳統的純文字維護方式。

Character.AI 正透過發布三部 AI 輔助系列劇進入微短劇市場。這些劇集允許使用者在每集結束後與角色進行對話與角色扮演。

本研究綜合了 27 篇論文,將 LLM 代理的限制歸納為六大失敗集群,包括工具使用、規劃及長程推理。研究指出,單一子任務的性能提升並不能保證複雜代理工作流程的端到端可靠性。

FirstResearch 引入了一種結構化的「研究問題證書」,使 LLM 生成的科學假設具備可檢查性和可審計性。該框架透過強制執行科學發現的明確推導約束,表現優於現有的基準代理。

研究人員正將 AI 應用從簡單的社交模擬轉向關鍵的緊急疏散規劃,利用大語言模型驅動的智能體來模擬人類在壓力下的決策行為。

RSEA 引入了一種讓 LLM 代理透過嚴格的留出驗證(held-out selection)機制,來演化自身策略、技能與工作流程的方法。此方法確保了性能的單調安全性,避免了無防護自我演化方法中常見的效能倒退問題。

研究人員提出了一種三階段訓練流程,使 LLM 代理具備「假設性」推理能力。透過內化世界模型,代理可以在執行前模擬未來結果並評估計畫。