Search

Tag: #agent-benchmarks6 results

DeepSeek V4 Flash 重設 AI API 價格底線

DeepSeek V4 Flash 重設 AI API 價格底線

DeepSeek 開放 V4 Flash API 公測,憑藉顯著的價格優勢與更高的 Agent 基準測試表現,加劇市場所稱的「DeepSeek 斬殺線」。文章認為,模型公司面臨長期回報不確定性,因為成本快速下降、切換成本低與高額資本需求,可能讓效率紅利流向開發者與應用公司。

LLM 使用者模擬過度放大代理成功

LLM 使用者模擬過度放大代理成功

研究人員揭露 LLM 基於使用者模擬在代理任務中的 Sim2Real 差距,顯示其過度合作且缺乏人類挫折感,製造「簡單模式」。首次以 451 名真人執行完整 τ-bench,透過新 User-Sim Index (USI) 基準測試 31 個 LLM。結果呼籲在代理開發中使用真人驗證而非未經驗證的模擬。

ProEvolve:代理基準的可程式化演進

ProEvolve:代理基準的可程式化演進

ProEvolve 是一個圖形基礎框架,用於可擴展、可控的代理環境演進,以測試 LLM 代理對現實世界變化的適應性。它使用類型化關係圖統一資料、工具和架構,透過圖形轉換實現更新並一致傳播。系統從單一環境生成 200 個環境和 3,000 個任務沙盒用於基準測試。

ArXiv AIResearchMar 9#agent-benchmarks#graph-framework