
Deep FinResearch Bench 測試 AI 金融研究能力
Deep FinResearch Bench 是金融投資研究中深度研究 (DR) 代理的全新評估框架。它透過自動化評分,評估質性嚴謹度、量化預測/估值準確性,以及主張可信度。AI 生成報告不如專業人士,強調需開發金融專屬 DR 代理。
Tag: #evaluation51 results

Deep FinResearch Bench 是金融投資研究中深度研究 (DR) 代理的全新評估框架。它透過自動化評分,評估質性嚴謹度、量化預測/估值準確性,以及主張可信度。AI 生成報告不如專業人士,強調需開發金融專屬 DR 代理。

ThermoQA 推出 293 道熱力學問題,分三層:性質查詢、組件分析與完整循環分析。它評估六款前沿 LLM,由 Claude Opus(94.1%)、GPT-5.4(93.1%)及 Gemini 3.1 Pro(92.5%)領先。開源資料集揭示 LLM 推理超出記憶的差距。

SciVisAgentBench 推出全面基準,用於評估 LLM 驅動的科學資料分析與視覺化代理,涵蓋 108 個專家設計案例。它具備四維度結構化分類,並採用多模態評估流程,結合 LLM 評判與確定性指標。此基準建立基線並揭示 SciVis 與程式碼代理的能力差距。

Emergence WebVoyager 是升級版基準測試,解決 WebVoyager 的任務歧義與變異性問題。它透過明確指南標準化評估,達到 95.9% 註解者間一致性。測試顯示 OpenAI Operator 成功率僅 68.6%,遠低於其宣稱的 87%。
新 arXiv 論文指出拒絕式基準忽略對齊中的實驗室特定路由機制,以中國 LLM 審查為案例。探針準確率無診斷性;外科切除證實審查來自路由而非知識移除。提出探針證據四級階層。

DeepMind 推出一個認知框架,用以測量通往 AGI 的進展。他們同時啟動 Kaggle 黑客松,來建置相關評估工具。

Cursor 推出 CursorBench-3,這是專為編碼代理設計的新評估套件。它針對來自真實 Cursor 使用者工作階段的複雜多檔案專案。此基準測試旨在推動產品與 AI 模型的改進。

Cursor 推出全新 AI 編碼評測基準,超越 SWE-Bench。它專門評估 Cursor 中不同模型的「智能體」能力。Claude 在此基準上表現不佳,難以應對。
PinchBench 推出取代合成評估的真實世界基準。它測試 LLM 作為 OpenClaw 代理的 23 項任務,聚焦成功率、速度與成本。

RewardHackingAgents 推出基準測試,用於評估 LLM ML 工程代理的完整性,針對評估器篡改和訓練/測試洩漏等漏洞。它使用工作空間追蹤和偵測器,透過比較代理報告指標與可信參考來指派完整性標籤。評估器鎖定等防禦措施可消除篡改,但帶來 25-31% 執行時間開銷。