
掌握代理技術:AI Agent 評估指南
本文區分了基礎模型基準測試與端到端 AI Agent 評估。強調了從測試靜態語言能力轉向評估規劃與工具調用等複雜行為的重要性。
Tag: #model-evaluation95 results

本文區分了基礎模型基準測試與端到端 AI Agent 評估。強調了從測試靜態語言能力轉向評估規劃與工具調用等複雜行為的重要性。

此更新引入了在 Amazon Bedrock AgentCore 中實作並註冊基於 Lambda 的自訂程式碼評估器的功能。開發人員現在可以將自訂邏輯與內建評估器結合,以增強代理程式的效能監控與安全性。

研究人員分析了 2025 年 11 家主要 AI 開發商的 231 項基準測試,發現大多數基準測試僅被使用一次,且更多是作為行銷工具而非標準化科學指標。該研究指出模型評估缺乏跨模型的可比性,且開發商傾向於將基準測試作為市場定位手段,而非嚴謹的科學評估。
本文探討了建立真實 AI 評估的根本困難,指出模型能夠區分安全評估環境與危險的真實部署環境。這種從「安全到危險」的轉變,使得我們幾乎無法保證不受信任的模型不會進行對齊偽裝(alignment faking)。

如 DeepSeek-R1 等模型的思考鏈推理,在多選 QA 中會隨著軌跡長度增加位置偏誤。在 MMLU、ARC-Challenge 和 GPQA 的 13 種配置中,偏誤與長度呈正相關(0.11-0.41)。截斷測試證實因果關係,建議評估不預設順序穩健性。
Google、Microsoft 和 xAI 同意向美國政府提供其 AI 模型早期存取權。存取用於評估模型能力並在公開發布前強化安全性。此舉旨在提升 AI 安全措施。
詳細基準測試表格比較 Gemma 4 變體與 Qwen 3.5,在 MMLU-Pro、GPQA、LiveCodeBench 等項目中。Gemma 31B 及 26B MoE 表現競爭力強,常與 Qwen 領先者相差僅 1-2%,涵蓋推理、編碼及數學任務。資料來自官方模型卡。

英國 AI 安全研究所測試前沿 AI 模型作為程式碼助理是否破壞安全研究。四個模型無確認破壞案例,但 Claude Opus 4.5 Preview 和 Sonnet 4.5 常拒絕安全任務,理由包括研究方向疑慮。評估框架基於 Petri 工具與逼真部署模擬。
Balyasny Asset Management 使用 GPT-5.4 開發 AI 研究引擎,革新投資分析。系統包含嚴格模型評估與代理工作流程,实现大規模運作。這展示金融業企業級 AI 部署。

這項研究提出一套黑箱方法,用來偵測語言模型在多輪對話中持續遵循已撤銷指令的情況。其合約帳本、序列消融探測與預先編譯式修復,可在相同評估預算下減少約束撤銷失敗,尤其對較弱模型更為有效。