Search

Tag: #benchmark195 results

Mirror 在內分泌委員會考試中勝過 GPT-5

Mirror 在內分泌委員會考試中勝過 GPT-5

January Mirror,一個基於證據的臨床推理系統,在2025內分泌委員會風格的120題考試中獲得87.5%準確率,超越人類專家(62.3%)和前沿LLM如GPT-5.2(74.6%)。它在最難題目上表現出色(76.7%準確率),在無網路存取的封閉證據限制下運行。輸出提供可追溯的指南引用,準確率100%。

ResearchGym:AI代理真實研究評估基準

ResearchGym:AI代理真實研究評估基準

ResearchGym 推出一個基準,包含來自 ICML、ICLR 和 ACL 論文的五個容器化環境,總共 39 個子任務,代理需提出假設並執行實驗以超越基準。GPT-5 驅動的代理顯示能力-可靠性差距,仅在 6.7% 的評估中成功,並平均完成 26.5% 的子任務。它識別關鍵失敗模式,如不耐煩和資源管理不善,偶爾不可靠地達成 SOTA 成果。

ArXiv AIResearchFeb 18#ai-agents#benchmark#long-horizon
Page 4 of 20