
DeepMind 駁斥「越多智能體越好」
DeepMind 論文評估 180 種智能體配置及 5 種架構,揭示擴展極限:智能體過多若不匹配任務則損性能。在 Finance-Agent、網頁導航等基準測試 GPT/Gemini/Claude。提出智能體系統量化原則。
Tag: #agent-benchmarks6 results

DeepMind 論文評估 180 種智能體配置及 5 種架構,揭示擴展極限:智能體過多若不匹配任務則損性能。在 Finance-Agent、網頁導航等基準測試 GPT/Gemini/Claude。提出智能體系統量化原則。

AutoWorldModel-Bench 評估前沿程式代理是否能透過開放式研究自主改進世界模型,而非只完成預先定義的工程任務。在 64 次測試與 8 個遊戲環境中,Codex-5.4 和 Claude Opus 4.6 在 63 次測試裡改進了起始模型,且多數勝出修改都涉及實質性的研究變更。

DeepSeek 開放 V4 Flash API 公測,憑藉顯著的價格優勢與更高的 Agent 基準測試表現,加劇市場所稱的「DeepSeek 斬殺線」。文章認為,模型公司面臨長期回報不確定性,因為成本快速下降、切換成本低與高額資本需求,可能讓效率紅利流向開發者與應用公司。

像 GLM-5 和 MiniMax M2.7 這樣的開放模型現在在核心代理任務上與封閉前沿模型匹敵,包括檔案操作、工具使用和指令遵循。它們以極低成本和延遲實現此性能。LangChain 的評估確認結果並提供實施指南。

研究人員揭露 LLM 基於使用者模擬在代理任務中的 Sim2Real 差距,顯示其過度合作且缺乏人類挫折感,製造「簡單模式」。首次以 451 名真人執行完整 τ-bench,透過新 User-Sim Index (USI) 基準測試 31 個 LLM。結果呼籲在代理開發中使用真人驗證而非未經驗證的模擬。

ProEvolve 是一個圖形基礎框架,用於可擴展、可控的代理環境演進,以測試 LLM 代理對現實世界變化的適應性。它使用類型化關係圖統一資料、工具和架構,透過圖形轉換實現更新並一致傳播。系統從單一環境生成 200 個環境和 3,000 個任務沙盒用於基準測試。