Search

直接匹配不多,已補上最新動態。

Tag: #evals4 results

Anthropic 新增代理記憶與協調功能

Anthropic 新增代理記憶與協調功能

Anthropic 更新 Claude Managed Agents,新增 Dreaming 處理工作階段記憶反思、Outcomes 設定成功評量準則,以及 Multi-Agent Orchestration 任務委派。這些功能將基礎設施層整合至單一運行環境,對抗 LangGraph 與 CrewAI。企業面臨供應商鎖定與託管合規風險。

AgentFuel:時序代理客製化評估

AgentFuel:時序代理客製化評估

研究人員評估 6 款資料分析代理,發現其在處理有狀態與事件特定時序查詢時存在缺口。他們推出 AgentFuel,協助領域專家快速建立客製化、具表現力的端到端評估基準。基準資料集已在 Hugging Face 上提供。

ArXiv AIResearchMar 16#timeseries#ai-agents#evals
Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。