
Papers with Code 推出專屬機器人基準測試頁面
Papers with Code 推出了專屬的機器人技術專區,用於追蹤主要基準測試、熱門論文和開源項目。目前涵蓋了 LIBERO 和 SimplerEnv 等基準測試中的 110 多個項目。
Tag: #benchmarking171 results

Papers with Code 推出了專屬的機器人技術專區,用於追蹤主要基準測試、熱門論文和開源項目。目前涵蓋了 LIBERO 和 SimplerEnv 等基準測試中的 110 多個項目。
研究人員發布了 ALEM 基準測試,旨在評估 LLM 代理在複雜、開放式環境中的協作能力。測試結果顯示,儘管大多數模型表現不佳,但 Gemini 3.1 Pro 在高難度任務中展現了與專業訓練模型相當的潛力。

Long-Horizon-Terminal-Bench 引入了一套新的 AI 代理評估框架,包含 46 項需要長期規劃與迭代除錯的複雜多步驟任務。該基準測試透過提供密集的中間獎勵,能比傳統僅評估最終結果的方法更精確地衡量代理在開放式工作流程中的進展。

Vercel 的 AI Gateway 排行榜現在提供可分享的圖表以及對生產流量數據的開放存取。使用者可以透過可下載的 CSV 或程式化匯出端點來分析模型、實驗室、應用程式與供應商的效能。

本研究綜述透過將臨床能力等級與計算推理模式進行對應,評估了大型語言模型在醫療領域的應用。文中引入了一個涵蓋五個推理層級的基準測試,並比較了 18 種先進模型,以識別臨床實踐中的效能差距。

研究人員提出了一種結合 LLM 推理與 SageMath 可驗證計算的 ReAct 風格代理框架。研究顯示,該架構在多種模型上均顯著提升了效能,有效縮小了開源權重模型與閉源模型之間的差距。

這項研究提出了一種評估超越人類能力 AI 模型的新範式,透過相對衡量而非靜態基準來進行評估。該框架利用模型生成的挑戰,建立了一套能隨代理能力同步擴展的對抗性心理測量評分系統。

AgentLens 是一個全新的開源基準測試,旨在根據編碼代理的完整互動軌跡進行評估,而非僅僅依賴二元通過/失敗的結果。它結合了形式驗證與 LLM 生成的評論,為代理的行為與效能提供具體的分析見解。

RoboDojo 作為具身智能的全新高難度評測基準正式發布,揭示了人類與當前 AI 模型在物理任務執行上的巨大差距。測試顯示,即使是最先進的模型在處理具身任務時,距離人類水平仍有顯著落差。
OpenAI 發布了一項分析,強調 SWE-Bench Pro 評測基準中的重大缺陷。該報告質疑目前用於評估 AI 程式編寫能力的評測方法之準確性與可靠性。