Search

Tag: #llm-agents89 results

PExA 在 Spider 2.0 達 70.2% SOTA

PExA 在 Spider 2.0 達 70.2% SOTA

PExA 將 text-to-SQL 重新表述為軟體測試覆蓋率,使用平行原子 SQL 測試案例確保語義覆蓋。僅在探索足夠資訊後生成最終 SQL,解決 LLM 代理的延遲-效能權衡問題。在 Spider 2.0 基準測試中達成 70.2% 執行準確率新 SOTA。

ArXiv AIResearchApr 28#text-to-sql#llm-agents#benchmark
MiRA 強化開源 LLM 代理超越 GPT-4

MiRA 強化開源 LLM 代理超越 GPT-4

研究人員提出子目標驅動框架與 MiRA RL 方法,解決 LLM 代理在網頁導航的長時程規劃問題。MiRA 將 Gemma3-12B 在 WebArena-Lite 的成功率從 6.4% 提升至 43%,超越 GPT-4-Turbo (17.6%) 與 GPT-4o (13.9%)。此規劃與里程碑獎勵組合提升自主 AI 能力。

Page 1 of 9