
從零到生產的醫療 Agent 工程化落地
螞蟻集團分享了醫療 Agent 的工程化範式,強調從傳統代碼驅動開發轉向數據驅動與 Badcase 導向的迭代模式。文章重點介紹了在高風險醫療場景中,嚴謹的評估框架與風險防控體系的重要性。
Tag: #evaluation-framework17 results

螞蟻集團分享了醫療 Agent 的工程化範式,強調從傳統代碼驅動開發轉向數據驅動與 Badcase 導向的迭代模式。文章重點介紹了在高風險醫療場景中,嚴謹的評估框架與風險防控體系的重要性。

加州大學柏克萊分校研究人員推出了「Agents’ Last Exam」(ALE),這是一項嚴格的基準測試,旨在評估 AI 代理在真實、長週期專業工作流程中的表現。GPT-5.5 獲得最高分,擊敗了 Anthropic 的 Claude Fable 5,該測試強調實際勞動力影響而非靜態編碼難題。

微軟開源了 ASSERT 框架,該框架能將自然語言行為規範轉換為 AI 智能體的可執行評估流程。它能根據定義的政策與約束,自動生成測試案例並進行評分。

本文為 AI 產品經理提供了一份從手動評測工作流轉向系統化、自動化評測框架的全面指南。強調了定義明確指標、基於角色的評測以及迭代優化的重要性。

Apple 推出了 Proactive Agent Research Environment (Pare),這是一個旨在為主動式數位助理模擬真實用戶互動的新框架。它透過將應用程式建模為有狀態的順序環境,而非簡單的工具呼叫 API,解決了當前的技術限制。
REAP 是一個全新的框架,透過從互動式生產環境的使用數據中提取資訊,自動化建構編碼代理(Coding Agent)的基準測試。此研究旨在縮小合成基準測試與真實軟體工程任務之間的差距。

AI 代理測試新創公司 Patronus AI 獲得 5,000 萬美元融資,將用於開發專門對 AI 代理進行壓力測試的「數位世界」。該公司由前 Meta AI 研究人員創立,目前市場對其安全性與評估基礎設施的需求極高。
OpenAI 推出「部署模擬」(Deployment Simulation),這是一種利用真實對話數據在模型公開發布前預測其行為的新方法。此舉旨在增強安全協議並提高模型評估的準確性。
Agent-EvalKit 是一個新的開源工具包,旨在為 AI 代理提供結構化的評估基礎設施。它與 Claude Code 和 Kilo Code 等熱門編碼助手整合,簡化了跨六個不同階段的測試流程。
本文指出目前的 AI 評估過度集中於能力指標,這反而會產生加速模型開發的外部效應。作者建議應轉向「行為評估」,以量化模型在諂媚傾向、內在渴望及環境操弄等方面的行為表現。