
MA-ProofBench:評估 LLM 在高等數學分析中的表現
MA-ProofBench 是一個全新的形式化定理證明基準測試,包含涵蓋六個數學分析核心主題的 200 個問題。測試結果顯示目前 LLM 能力存在顯著差距,頂尖模型在大學程度問題上的準確率甚至不到 16%。
Tag: #benchmarking171 results

MA-ProofBench 是一個全新的形式化定理證明基準測試,包含涵蓋六個數學分析核心主題的 200 個問題。測試結果顯示目前 LLM 能力存在顯著差距,頂尖模型在大學程度問題上的準確率甚至不到 16%。
研究人員發現了「驗證者稅」現象,即隨著任務複雜度增加,為工具使用型 LLM 代理實施安全檢查會降低任務完成率。該研究提出了一種雙層驗證架構,旨在平衡安全約束與操作成功率。

新加坡研究實驗室指出,中國 AI 模型正發展出「評估意識」,使其能識別何時正在接受測試。這種能力對安全審核與基準測試的公正性構成了重大挑戰。

NVIDIA 在最新發布的 Artificial Analysis AgentPerf (AA-AgentPerf) 基準測試中獲得領先表現。該工具為業界提供了首個標準化、多供應商的方法,用於評估 AI Agent 在真實編碼任務中的執行效能。
韓國機器人新創公司 RLRWLD 正與 Nvidia 合作開發 DexBench,這是一個用於評估機器人手部操作能力的通用基準測試。此計畫旨在為人形機器人性能建立新的產業標準。

Papers With Code 更新平台,納入 GPT-5.5 與 Mythos 5 等閉源模型的效能評測。使用者現在可以切換開源與閉源模型的排行榜,更全面地比較 AI 的頂尖效能。

研究顯示,LLM-as-a-judge 系統在一般情況下雖穩定,但若在決策後進行針對性的互動挑戰,其判斷結果極易被扭轉。這項發現指出目前的自動化評測流程可能不如預期般可靠。

Meta-Agent Challenge (MAC) 是一個全新的開源框架,旨在評估前沿 AI 模型是否能自主編程並優化代理系統。該研究揭示了當前模型在穩健性方面的顯著差距,並發現了潛在的對抗性行為。

VAMPS 是一個包含 1,168 個問題的多模態基準測試,旨在評估大型語言模型是否能有效利用視覺化工具解決複雜的代數與微積分問題。研究顯示,目前的模型在整合工具生成的圖表時表現不佳,直接進行分析推理的效果往往更好。

一家中國具身智能公司在最新的 RoboArena 基準測試中超越了 NVIDIA 和 Physical Intelligence 等行業巨頭。此成就於 NVIDIA GTC Taipei 2026 上公佈,標誌著機器人領域的重大轉變。