NVIDIA AVO 取得 ARC-AGI-3 滿分
據報導,NVIDIA AVO 在 ARC-AGI-3 取得 100% 成績,完成 25 個公開環境中的全部 183 個關卡。這項結果顯示其具備強大的無指令任務探索能力,但消息來自 Reddit 貼文,仍需獨立驗證。
Tag: #agent-evaluation34 results
據報導,NVIDIA AVO 在 ARC-AGI-3 取得 100% 成績,完成 25 個公開環境中的全部 183 個關卡。這項結果顯示其具備強大的無指令任務探索能力,但消息來自 Reddit 貼文,仍需獨立驗證。

Ora 讓 Claude Code、ChatGPT、Gemini、Hermes、OpenClaw 與 Vercel 的 eve Agent framework 執行真實網站工作流程,以衡量它們完成任務的能力。初步比較顯示,eve 所需步驟少 7%、原生完成率達兩倍,並多找到 9% 可實際呼叫的有效端點。

FinSkillBench 是一套全新的基準測試,用於評估 AI 代理在投資組合建構、風險管理與基本面分析上的能力。在 9 個模型的測試中,精選程序技能將平均表現從 0.366 提升至 0.528,而代理自行生成的技能幾乎沒有帶來效益。

NVIDIA SkillEvaluator 用於衡量封裝後的 agent skills 是否能改善 AI agent 的表現。它評估指令、範例與工具指南的價值,協助 agent 找到相關上下文、減少無效步驟,更有效完成專業任務。

Anthropic 的研究探討多 Agent 系統如何提升探索效率,同時帶來新的協調與系統性失敗風險。實驗顯示,Agent 同質化、程式碼所有權與資源競爭,可能把個體的小錯誤放大成群體層級的故障。

這篇立場論文主張,AI 代理應被視為行為系統進行評估,而不只是檢視最終效能結果。論文提出系統性觀察、環境擾動與行動序列分析,以了解代理如何做決策及適應環境。

LangSmith Tuned Evaluators 將品質回饋直接附加至正式環境的追蹤記錄,初期支援 Perceived Error。此功能可協助團隊找出並修正 AI 代理程式的錯誤。

RubricForge 從少量具備真實結果標註的代理軌跡中,自動生成可讀的人類評分規範,之後可在不存取環境的情況下套用固定規範。在 tau-bench 與 WebShop 上,它大幅降低失敗軌跡被誤判為通過的比例,並改善分級結果排序;但整體一致性並未顯著優於 G-Eval。

研究人員提出 Behavioral Consistency Metric(BCM),用於衡量語言模型 Agent 跨任務的行為一致性,而不只是評估是否成功。在約 9,000 條軟體工程執行軌跡上的測試顯示,跨任務一致性與重複嘗試時的一致性是兩種不同特性。

AOE Tech Labs 表示,其 Floatboat Harness 讓 DeepSeek-V4-Flash 在五項測試基準中全部擊敗 Claude Opus 4.8。這項單一變因實驗只更換執行 Harness,並使用相同的 0.14 美元模型,成本低至 57.1 分之一。