
BehaviorBench:從行為軌跡建模真實用戶決策
BehaviorBench 是一個新的基準測試,旨在利用來自預測市場和鏈上紀錄的真實行為數據來評估個性化決策建模。它挑戰模型在超過 160 萬個實例中預測用戶立場和交易行為,超越了模擬用戶環境的限制。
Tag: #benchmarking171 results

BehaviorBench 是一個新的基準測試,旨在利用來自預測市場和鏈上紀錄的真實行為數據來評估個性化決策建模。它挑戰模型在超過 160 萬個實例中預測用戶立場和交易行為,超越了模擬用戶環境的限制。

Artificial Analysis 與 IBM 發布了 ITBench-AA,這是首個專為評估企業 IT 環境中代理 AI(Agentic AI)性能而設計的基準測試。結果顯示,目前的前沿模型表現不佳,所有模型的準確率均低於 50%。

JobBench 是一個全新的基準測試,旨在評估 AI 代理在專家優先處理的工作流程中的表現,而非僅僅評估其經濟替代價值。該基準涵蓋了 35 個職業中的 130 項任務,凸顯了當前模型性能與實際專業需求之間的差距。

UniPat AI 發布了 SaaS-Bench 評測,顯示包括 Claude 在內的主流大模型在真實辦公任務中的完全通過率低於 4%。這表明 AI 全自動辦公距離實際落地仍有很大差距。

CRUX 專案引入了「開放世界評估」,旨在透過長週期、真實世界的任務而非靜態基準測試來衡量前沿 AI 能力。這種方法透過在複雜的定性環境中測試 AI 代理,旨在為新興能力提供早期預警。

ResearchArena 評估了現成 AI 代理人執行完整研究循環(從構思到論文撰寫)的能力。研究顯示,雖然代理人能產出看似合理的論文,但在實驗嚴謹度與事實準確性方面仍有顯著缺陷。

POLAR-Bench 是一個全新的診斷基準,旨在測試 LLM Agent 在與對抗性第三方系統互動時,如何處理私有用戶數據。研究顯示,頂尖模型與較小的開源模型在隱私對齊方面存在顯著的效能差距。

DecisionBench 是一個旨在評估 AI 代理如何在長程工作流程中進行任務委派的新基準測試。它提供了一個標準化框架,用於衡量不同模型系列在路由保真度、成本和品質方面的表現。

本文區分了基礎模型基準測試與端到端 AI Agent 評估。強調了從測試靜態語言能力轉向評估規劃與工具調用等複雜行為的重要性。

LinAlg-Bench 是一個全新的診斷基準測試,用於評估 10 個前沿大型語言模型在線性代數任務上的表現。研究發現模型在 4x4 矩陣規模時會出現關鍵行為轉折,從算術錯誤轉變為結構性幻覺與計算放棄。