Search

Tag: #benchmark195 results

PExA 在 Spider 2.0 達 70.2% SOTA

PExA 在 Spider 2.0 達 70.2% SOTA

PExA 將 text-to-SQL 重新表述為軟體測試覆蓋率,使用平行原子 SQL 測試案例確保語義覆蓋。僅在探索足夠資訊後生成最終 SQL,解決 LLM 代理的延遲-效能權衡問題。在 Spider 2.0 基準測試中達成 70.2% 執行準確率新 SOTA。

ArXiv AIResearchApr 28#text-to-sql#llm-agents#benchmark
AgentSearchBench:AI 代理搜尋基準測試

AgentSearchBench:AI 代理搜尋基準測試

AgentSearchBench 推出一個使用近 10,000 個來自多供應商的真實世界代理的大型基準測試,用於 AI 代理搜尋。它將搜尋形式化為可執行和高階查詢下的擷取與重新排序,並透過執行基礎效能評估。實驗顯示語意方法不足,而執行感知探測可提升排序品質。

ArXiv AIResearchApr 27#ai-agents#benchmark#retrieval
XpertBench:專家級 LLM 基準測試

XpertBench:專家級 LLM 基準測試

XpertBench 推出 1,346 個專家策劃的任務,涵蓋金融、醫療等 80 個專業領域,用以評估 LLM 在複雜開放任務上的表現。採用詳細評分表與 ShotJudge,這是一種使用少樣本範例校準的 LLM 評判方法,以減輕偏差。頂尖 LLM 僅達 66% 最高成功率,凸顯「專家差距」。

ArXiv AIResearchApr 6#benchmark#rubrics#expert-tasks
Page 2 of 20