🏠較早收集於 3h

微軟發布 ASSERT 開源框架,用於評估 AI 智能體行為

微軟發布 ASSERT 開源框架,用於評估 AI 智能體行為
PostLinkedIn
🏠閱讀原文: IT之家

💡微軟推出的開源框架,用於自動化與標準化 AI 智能體的安全性與政策評估。

⚡ 30-Second TL;DR

有什麼變化

將自然語言需求轉化為可執行的評估流程

為什麼重要

ASSERT 為 AI 安全與對齊提供了一種系統化方法,協助開發者從人工測試轉向可擴展的政策驅動評估。

下一步行動

將 ASSERT 整合至您的 CI/CD 流程中,以自動化評估您的 LLM 智能體是否符合特定的安全政策。

誰應關注:Developers & AI Engineers

關鍵要點

  • 將自然語言需求轉化為可執行的評估流程
  • 自動生成測試場景、數據集與計分卡
  • 支援多輪對話場景與對抗性探測
  • 經驗證,LLM 判定器與人工審核的一致率達 80-90%

🧠 深度解析

Web-grounded analysis with 14 cited sources.

🔑 增強重點摘要

  • ASSERT 框架旨在透過將自然語言行為規範自動轉化為可執行評估流程,並自動生成測試案例,從而降低 AI 品質保證的門檻,並能及早發現潛在的迴歸問題。
  • 該框架被設計為可整合到持續整合/持續部署 (CI/CD) 流程中,以實現 AI 智能體行為的持續品質保證和迴歸測試,確保模型在迭代過程中保持穩定性。
  • ASSERT 是微軟更廣泛的「負責任 AI」策略中的一環,該策略還包括近期開源的 Rampart 和 Clarity 等工具,這些工具旨在將 AI 安全檢測提前至開發生命週期的早期階段。
  • 其評估流程系統化地分為四個階段:規範細化、用例生成、軌跡錄製與行為評分,以確保全面且結構化的評估。
📊 競品分析▸ Show
特性/產品Microsoft ASSERT
主要焦點將自然語言規範轉化為可執行評估流程,自動生成測試案例,評估 AI 智能體行為。
開源/商業開源
關鍵能力自動生成測試場景、數據集、指標與計分卡;支援多輪對話與對抗性探測;LLM 判定器與人工審核一致率達 80-90%。
定價免費 (開源)
基準測試LLM 判定器與人工審核一致率達 80-90%。
特性/產品Agentneo (ragaAI)
主要焦點AI 智能體與 LLM 的觀察、監控與評估框架。
開源/商業Python SDK (開源)
關鍵能力追蹤智能體與 LLM、工具使用情況;調試多智能體系統;提供交互式儀表板;與 Autogen、Crewai 等多智能體庫集成。
定價未明確提及,但 SDK 通常免費,可能提供企業級服務。
基準測試未明確提及具體基準。
特性/產品AgentBench (清華大學)
主要焦點專注於通用人工智能 (AGI) 能力評估的學術研究基準。
開源/商業學術研究型基準
關鍵能力涵蓋操作系統、數據庫、知識圖譜等 8 個不同環境的綜合性評測。
定價免費 (研究用途)
基準測試涵蓋 8 個環境的綜合性評測。
特性/產品H2O Eval Studio
主要焦點自動化評估流水線,多維度性能指標,RAG 應用專項評估,安全性合規檢查。
開源/商業商業級平台
關鍵能力支援預設或自定義評估任務一鍵執行;提供準確性、流暢性、邏輯性等文本生成質量量化;內置對抗性測試與內容安全過濾;可視化對比分析。
定價商業定價 (未公開)
基準測試生成模型迭代前後的性能對比報告與圖表。
特性/產品OpenCompass (司南)
主要焦點大語言模型、多模態模型、具身智能、安全可信及科學智能評測。
開源/商業開源可復現框架
關鍵能力支持對文本生成與理解能力的多維度自動化評估;評估圖文混合輸入下的感知、推理與生成能力;提供完整、透明的評測代碼與流程。
定價免費 (開源)
基準測試提供模型性能排行榜。

🛠️ 技術深入

  • 全稱: ASSERT 代表「Adaptive Spec-driven Scoring for Evaluation and Regression Testing」(自適應規範驅動評分,用於評估和迴歸測試)。
  • 核心功能: 將自然語言撰寫的行為規範直接轉換為可執行的評估流程。
  • 測試案例生成: 能夠從產品需求、政策文件或系統提示等文本中,自動生成測試場景、數據集、評估指標和計分卡。
  • 評估階段: 評估流程分為四個階段:規範細化、用例生成、軌跡錄製與行為評分。
  • 支援場景: 支援多輪對話場景與對抗性探測,以全面評估 AI 智能體的穩健性。
  • 一致性驗證: 經驗證,LLM 判定器與人工審核的一致率可達 80% 至 90%。
  • 整合性: 旨在將 AI 安全檢測前置於開發生命週期,並可整合到 CI/CD 工作流中,實現持續檢測迴歸問題。

🔮 前景展望AI analysis grounded in cited sources

AI 智能體的開發與部署將變得更加安全與高效。
ASSERT 透過自動化自然語言規範到可執行評估的流程,顯著降低了 AI 品質保證的門檻,並能及早發現潛在問題。
負責任 AI 的實踐將加速成為行業標準。
微軟開源 ASSERT 等工具,鼓勵業界將 AI 安全與倫理評估前置於開發生命週期,推動更廣泛的採納。
AI 智能體市場的成熟度將顯著提升。
隨著更可靠、標準化的評估工具普及,開發者能更有效地驗證和改進 AI 智能體,從而加速其在實際應用中的落地。

時間線

2017
微軟提出其六項 AI 原則,作為負責任 AI 的指導方針。
2019
微軟成立「負責任 AI 辦公室」,並設立全球首個「負責任 AI 長」職位。
2022
微軟發布第一版負責任 AI 標準,將 AI 原則落實到產品開發中。
2023
微軟更新負責任 AI 標準至第二版,持續完善 AI 治理框架。
2024-05
微軟發布首份年度《負責任 AI 透明度報告》,詳細闡述 AI 技術的開發與監察。
2025-05
微軟在 Build 大會上宣布 GitHub Copilot 進入「智能體時代」,並推出 Copilot Studio 以構建多智能體系統,預示對智能體評估需求的增長。
2026-05
微軟開源 Rampart 和 Clarity 兩款工具,旨在將 AI 安全檢測提前至智能體開發生命週期的早期階段。

📎 來源 (14)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. yingzheng.com
  2. virxact.com
  3. 163.com
  4. unwire.pro
  5. udn.com
  6. hk01.com
  7. donews.com
  8. ithome.com
  9. aixq.cc
  10. oschina.net
  11. betteryeah.com
  12. airukou.cn
  13. microsoft.com
  14. wallstreetcn.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家