Search

Tag: #benchmark195 results

SocialGrid:具身多代理社交推理基準

SocialGrid:具身多代理社交推理基準

SocialGrid 推出受 Among Us 啟發的具身多代理基準,用於評估 LLM 代理在規劃、任務執行與社交推理的能力。頂尖模型如 GPT-OSS-120B 的任務完成率低於 60%,在導航與欺騙偵測上掙扎。它提供規劃預言機以隔離社交技能,並包含故障分析與競爭排行榜。

ArXiv AIResearchApr 21#multi-agent#embodied-ai#benchmark
RiskWebWorld:電商風險管理真實GUI代理基準

RiskWebWorld:電商風險管理真實GUI代理基準

RiskWebWorld 是電商風險管理中 GUI 代理的第一個真實互動基準,包含來自 8 個領域生產管道的 1,513 個任務。它涵蓋不合作網站和部分環境劫持等挑戰,並提供 Gymnasium 相容基礎設施以支援可擴展評估與 RL。評估顯示頂級模型成功率 49.1%,強調基礎模型規模比零樣本介面 grounding 更重要。

ArXiv AIResearchApr 17#gui-agents#e-commerce#benchmark
EGB 提升大型工具空間長視野規劃

EGB 提升大型工具空間長視野規劃

推出 SLATE,一個大型電子商務基準測試,用於評估工具增強 LLM 代理,暴露自我修正與搜尋效率問題。提出熵引導分支 (EGB),一種不確定性感知演算法,優先高熵決策分支。在 SLATE 上實現更高成功率與計算效率。

ArXiv AIResearchApr 16#agent#benchmark#planning
PilotBench:通用航空AI安全基準

PilotBench:通用航空AI安全基準

PilotBench 是用於評估大型語言模型(LLMs)在安全關鍵飛行軌跡與姿態預測的基準,使用708條真實世界通用航空軌跡。它引入 Pilot-Score,權重60%準確率與40%指令遵循及安全合規。LLMs 在可控性優異,但精準度落後傳統預測器,尤其在複雜飛行階段。

Page 8 of 20