
SocialGrid:具身多代理社交推理基準
SocialGrid 推出受 Among Us 啟發的具身多代理基準,用於評估 LLM 代理在規劃、任務執行與社交推理的能力。頂尖模型如 GPT-OSS-120B 的任務完成率低於 60%,在導航與欺騙偵測上掙扎。它提供規劃預言機以隔離社交技能,並包含故障分析與競爭排行榜。
Tag: #benchmark195 results

SocialGrid 推出受 Among Us 啟發的具身多代理基準,用於評估 LLM 代理在規劃、任務執行與社交推理的能力。頂尖模型如 GPT-OSS-120B 的任務完成率低於 60%,在導航與欺騙偵測上掙扎。它提供規劃預言機以隔離社交技能,並包含故障分析與競爭排行榜。

ReactBench 推出用化學反應圖測試多模態大型語言模型拓撲推理的基準。包含 1,618 個專家註解的 QA 對,橫跨四個階層任務維度,從線性到循環結構。對 17 個 MLLMs 的評估顯示整體結構推理有 30% 性能差距,經消融實驗確認為推理瓶頸。

Honor 人形機器人 Lightning 以 50:26 完成 13 英里半馬拉松,減半先前機器人紀錄並擊敗人類世界紀錄 57:20。一年開發,具 90-95 公分仿菁英跑者腿部及 Honor 手機液冷。超越 12,000 名人類跑者。

KWBench 推出基準測試大型語言模型在知識工作情境中無明確提示下識別問題的能力。包含來自收購、詐欺分析等領域的 223 項任務,基於賽局理論模式,並採用三階評分標準。頂尖模型無提示通過率僅 27.9%,凸顯評估缺口。

RiskWebWorld 是電商風險管理中 GUI 代理的第一個真實互動基準,包含來自 8 個領域生產管道的 1,513 個任務。它涵蓋不合作網站和部分環境劫持等挑戰,並提供 Gymnasium 相容基礎設施以支援可擴展評估與 RL。評估顯示頂級模型成功率 49.1%,強調基礎模型規模比零樣本介面 grounding 更重要。

研究人員推出 REL,一個使用關係複雜度 (RC) 的生成基準框架,用以評估 LLM 在代數、化學和生物學中的高元關係推理能力。先進 LLM 在 RC 增加時表現持續單調下降,即使增加計算或上下文學習也無效。這突顯關係綁定的核心限制,呼籲重新檢視基準測試。

推出 SLATE,一個大型電子商務基準測試,用於評估工具增強 LLM 代理,暴露自我修正與搜尋效率問題。提出熵引導分支 (EGB),一種不確定性感知演算法,優先高熵決策分支。在 SLATE 上實現更高成功率與計算效率。

LABBench2 推出近 1,900 項任務,測量 AI 系統在生物研究真實情境的能力,為 LAB-Bench 的進化版。頂尖模型雖有進步,但準確率下降 26-46%。資料集在 Hugging Face;評估工具在 GitHub。

ViSA-R2 使用模擬物理學家推理的自驗證思考鏈,從二維線性穩態場域視覺化中恢復解析 SymPy 表達式。它引入 ViSA-Bench,一個包含 30 個可驗證情境的合成基準,用於 VLM 評估。基於 8B Qwen3-VL,表現優於開源基準和前沿 VLM。

PilotBench 是用於評估大型語言模型(LLMs)在安全關鍵飛行軌跡與姿態預測的基準,使用708條真實世界通用航空軌跡。它引入 Pilot-Score,權重60%準確率與40%指令遵循及安全合規。LLMs 在可控性優異,但精準度落後傳統預測器,尤其在複雜飛行階段。