🏠IT之家•較早收集於 3h
微軟發布 ASSERT 開源框架,用於評估 AI 智能體行為

💡微軟推出的開源框架,用於自動化與標準化 AI 智能體的安全性與政策評估。
⚡ 30-Second TL;DR
有什麼變化
將自然語言需求轉化為可執行的評估流程
為什麼重要
ASSERT 為 AI 安全與對齊提供了一種系統化方法,協助開發者從人工測試轉向可擴展的政策驅動評估。
下一步行動
將 ASSERT 整合至您的 CI/CD 流程中,以自動化評估您的 LLM 智能體是否符合特定的安全政策。
誰應關注:Developers & AI Engineers
關鍵要點
- •將自然語言需求轉化為可執行的評估流程
- •自動生成測試場景、數據集與計分卡
- •支援多輪對話場景與對抗性探測
- •經驗證,LLM 判定器與人工審核的一致率達 80-90%
🧠 深度解析
Web-grounded analysis with 14 cited sources.
🔑 增強重點摘要
- •ASSERT 框架旨在透過將自然語言行為規範自動轉化為可執行評估流程,並自動生成測試案例,從而降低 AI 品質保證的門檻,並能及早發現潛在的迴歸問題。
- •該框架被設計為可整合到持續整合/持續部署 (CI/CD) 流程中,以實現 AI 智能體行為的持續品質保證和迴歸測試,確保模型在迭代過程中保持穩定性。
- •ASSERT 是微軟更廣泛的「負責任 AI」策略中的一環,該策略還包括近期開源的 Rampart 和 Clarity 等工具,這些工具旨在將 AI 安全檢測提前至開發生命週期的早期階段。
- •其評估流程系統化地分為四個階段:規範細化、用例生成、軌跡錄製與行為評分,以確保全面且結構化的評估。
📊 競品分析▸ Show
| 特性/產品 | Microsoft ASSERT |
|---|---|
| 主要焦點 | 將自然語言規範轉化為可執行評估流程,自動生成測試案例,評估 AI 智能體行為。 |
| 開源/商業 | 開源 |
| 關鍵能力 | 自動生成測試場景、數據集、指標與計分卡;支援多輪對話與對抗性探測;LLM 判定器與人工審核一致率達 80-90%。 |
| 定價 | 免費 (開源) |
| 基準測試 | LLM 判定器與人工審核一致率達 80-90%。 |
| 特性/產品 | Agentneo (ragaAI) |
|---|---|
| 主要焦點 | AI 智能體與 LLM 的觀察、監控與評估框架。 |
| 開源/商業 | Python SDK (開源) |
| 關鍵能力 | 追蹤智能體與 LLM、工具使用情況;調試多智能體系統;提供交互式儀表板;與 Autogen、Crewai 等多智能體庫集成。 |
| 定價 | 未明確提及,但 SDK 通常免費,可能提供企業級服務。 |
| 基準測試 | 未明確提及具體基準。 |
| 特性/產品 | AgentBench (清華大學) |
|---|---|
| 主要焦點 | 專注於通用人工智能 (AGI) 能力評估的學術研究基準。 |
| 開源/商業 | 學術研究型基準 |
| 關鍵能力 | 涵蓋操作系統、數據庫、知識圖譜等 8 個不同環境的綜合性評測。 |
| 定價 | 免費 (研究用途) |
| 基準測試 | 涵蓋 8 個環境的綜合性評測。 |
| 特性/產品 | H2O Eval Studio |
|---|---|
| 主要焦點 | 自動化評估流水線,多維度性能指標,RAG 應用專項評估,安全性合規檢查。 |
| 開源/商業 | 商業級平台 |
| 關鍵能力 | 支援預設或自定義評估任務一鍵執行;提供準確性、流暢性、邏輯性等文本生成質量量化;內置對抗性測試與內容安全過濾;可視化對比分析。 |
| 定價 | 商業定價 (未公開) |
| 基準測試 | 生成模型迭代前後的性能對比報告與圖表。 |
| 特性/產品 | OpenCompass (司南) |
|---|---|
| 主要焦點 | 大語言模型、多模態模型、具身智能、安全可信及科學智能評測。 |
| 開源/商業 | 開源可復現框架 |
| 關鍵能力 | 支持對文本生成與理解能力的多維度自動化評估;評估圖文混合輸入下的感知、推理與生成能力;提供完整、透明的評測代碼與流程。 |
| 定價 | 免費 (開源) |
| 基準測試 | 提供模型性能排行榜。 |
🛠️ 技術深入
- 全稱: ASSERT 代表「Adaptive Spec-driven Scoring for Evaluation and Regression Testing」(自適應規範驅動評分,用於評估和迴歸測試)。
- 核心功能: 將自然語言撰寫的行為規範直接轉換為可執行的評估流程。
- 測試案例生成: 能夠從產品需求、政策文件或系統提示等文本中,自動生成測試場景、數據集、評估指標和計分卡。
- 評估階段: 評估流程分為四個階段:規範細化、用例生成、軌跡錄製與行為評分。
- 支援場景: 支援多輪對話場景與對抗性探測,以全面評估 AI 智能體的穩健性。
- 一致性驗證: 經驗證,LLM 判定器與人工審核的一致率可達 80% 至 90%。
- 整合性: 旨在將 AI 安全檢測前置於開發生命週期,並可整合到 CI/CD 工作流中,實現持續檢測迴歸問題。
🔮 前景展望AI analysis grounded in cited sources
AI 智能體的開發與部署將變得更加安全與高效。
ASSERT 透過自動化自然語言規範到可執行評估的流程,顯著降低了 AI 品質保證的門檻,並能及早發現潛在問題。
負責任 AI 的實踐將加速成為行業標準。
微軟開源 ASSERT 等工具,鼓勵業界將 AI 安全與倫理評估前置於開發生命週期,推動更廣泛的採納。
AI 智能體市場的成熟度將顯著提升。
隨著更可靠、標準化的評估工具普及,開發者能更有效地驗證和改進 AI 智能體,從而加速其在實際應用中的落地。
⏳ 時間線
2017
微軟提出其六項 AI 原則,作為負責任 AI 的指導方針。
2019
微軟成立「負責任 AI 辦公室」,並設立全球首個「負責任 AI 長」職位。
2022
微軟發布第一版負責任 AI 標準,將 AI 原則落實到產品開發中。
2023
微軟更新負責任 AI 標準至第二版,持續完善 AI 治理框架。
2024-05
微軟發布首份年度《負責任 AI 透明度報告》,詳細闡述 AI 技術的開發與監察。
2025-05
微軟在 Build 大會上宣布 GitHub Copilot 進入「智能體時代」,並推出 Copilot Studio 以構建多智能體系統,預示對智能體評估需求的增長。
2026-05
微軟開源 Rampart 和 Clarity 兩款工具,旨在將 AI 安全檢測提前至智能體開發生命週期的早期階段。
📎 來源 (14)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家 ↗


