☁️AWS Machine Learning Blog•較早收集於 23m
在 Amazon Bedrock AgentCore 中建立自訂程式碼評估器

#aws#agentic-ai#model-evaluation#serverlessamazon-bedrock-agentcoreamazon bedrockaws lambdaagentcore
💡學習如何使用 AWS Lambda 和 Amazon Bedrock AgentCore 為您的 AI 代理建立自訂驗證邏輯。
⚡ 30-Second TL;DR
有什麼變化
針對專業代理任務實作四種基於 Lambda 的自訂程式碼評估器。
為什麼重要
此功能允許開發人員注入特定領域的驗證邏輯,顯著提高了 AI 代理的可靠性。它彌補了通用評估指標與企業金融應用程式細微需求之間的差距。
下一步行動
為您的代理程式輸出實作一個自訂 Lambda 評估器,以強制執行特定領域的約束條件或 PII 遮罩。
誰應關注:Developers & AI Engineers
關鍵要點
- •針對專業代理任務實作四種基於 Lambda 的自訂程式碼評估器。
- •支援在 AgentCore 內進行按需與線上執行模式。
- •整合 AWS 服務以進行 PII 偵測、事實查核與即時警報。
🧠 深度解析
Web-grounded analysis with 26 cited sources.
🔑 增強重點摘要
- •除了內建評估器外,自訂程式碼評估器允許開發人員使用 AWS Lambda 函數實作確定性檢查、正規表達式匹配、計算自訂指標或應用業務特定規則,提供對評估邏輯的完全控制,而非僅依賴 LLM 作為判斷者。
- •AgentCore 評估功能還提供 13 種預建評估器,用於評估常見的品質維度,例如正確性、實用性、工具選擇準確性、安全性、目標成功率和上下文相關性。
- •評估結果與由 Amazon CloudWatch 提供支援的 AgentCore 可觀察性服務整合,實現統一監控和即時警報,幫助開發人員持續追蹤代理程式在生產環境中的表現。
- •按需評估模式支援在 CI/CD 管道中進行回歸測試和互動式開發工作流程,而線上評估模式則持續監控生產流量,確保代理程式品質。
📊 競品分析▸ Show
| 功能/方面 | Amazon Bedrock AgentCore | Google Cloud Gemini Enterprise Agent Platform (Vertex AI) | Anthropic Claude Managed Agents |
|---|---|---|---|
| 代理程式編排與部署 | 模組化平台,提供無伺服器執行環境,支援任何框架和模型(如 CrewAI, LangGraph)。 | 統一模型選擇、開發和部署,支援超過 200 種 AI 模型,提供 Agent Studio 和 Agent Development Kit。 | 託管的 Claude 原生工作者執行時,管理會話生命週期、執行流程和模型周邊,設計上更具規範性。 |
| 評估功能 | 提供 13 種內建評估器及基於 Lambda 的自訂程式碼評估器,支援按需和線上執行模式,並與 CloudWatch 整合。 | 提供 Gen AI 評估服務,支援最終回應評估和軌跡評估,可定義自訂指標。 | 專注於執行時的託管,間接包含對其託管方面(如會話處理、執行流程)的評估。 |
| PII 偵測與安全 | 明確提及 PII 偵測、事實查核和即時警報,並透過 Policy 功能提供代理程式行為的實時控制。 | 透過 Vertex AI 的 Guardrails 提供內容過濾和 PII 匿名化等安全功能。 | 透過其託管執行時提供安全隔離和憑證管理。 |
| 模型/框架靈活性 | 框架和模型無關,支援多種開源框架和基礎模型。 | 支援 Google 的 Gemini 系列及 Anthropic Claude 等第三方模型。 | 專為 Claude 基礎模型設計和優化。 |
| 定價 | null | null | null |
| 基準測試 | null | null | null |
🛠️ 技術深入
- 自訂程式碼評估器透過 AWS Lambda 函數實現,允許開發人員使用 Python 或 JavaScript 編寫評估邏輯。
- 這些評估器能夠執行確定性檢查、呼叫外部 API、進行正規表達式匹配、計算自訂指標以及應用業務特定規則。
- 使用自訂程式碼評估器需要一個 IAM 執行角色,以授予 AgentCore Evaluations 服務呼叫 Lambda 函數的權限。
- Lambda 函數必須返回符合特定 JSON 結構的響應。
- AgentCore Runtime 提供一個無伺服器執行環境,專為 AI 代理程式工作負載設計,具有完整的會話隔離、快速冷啟動和長達 8 小時的異步代理程式執行支援。
- AgentCore Gateway 負責將 REST API、AWS Lambda 函數和現有服務轉換為與模型上下文協議 (MCP) 相容的工具。
- PII 偵測通常利用命名實體識別 (NER)、模式匹配和驗證等技術(例如 Microsoft Presidio),並可實施遮蔽、編輯或雜湊處理等策略。
- 事實查核功能可涉及將複雜聲明分解為子任務、檢索外部證據(如 RAG)以及基於證據進行推理。
🔮 前景展望AI analysis grounded in cited sources
企業將能更自信地部署生成式 AI 代理程式於關鍵業務流程中。
自訂評估器與內建安全功能(如 PII 偵測和事實查核)的結合,顯著降低了代理程式行為不可預測和資料洩露的風險,滿足了企業對治理和可靠性的需求。
AI 代理程式的開發生命週期將更加整合與自動化。
支援 CI/CD 管道中的按需評估以及與 CloudWatch 的即時監控整合,將使開發人員能夠更快地迭代、測試和部署代理程式,同時確保生產品質。
⏳ 時間線
2023-04-13
Amazon Bedrock 宣布推出
2023-09-28
Amazon Bedrock 正式普遍可用
2025-07-16
Amazon Bedrock AgentCore 預覽版推出
2025-10-13
Amazon Bedrock AgentCore 正式普遍可用,包含核心服務
2025-12-02
Amazon Bedrock AgentCore 推出新的策略 (Policy) 和評估 (Evaluations) 功能
2026-03-31
Amazon Bedrock AgentCore Evaluations 正式普遍可用,支援自訂程式碼評估器
📎 來源 (26)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog ↗


