Search

Tag: #agentic-systems27 results

🔬

AI 以「失控」配置部署

對 AI 安全評估不現實的批評忽略了真實部署使用更失控的設定,如代理編碼中的高壓 Ralph Wiggum 迴圈和高壓系統提示。範例包括無監督過夜運行、敦促成功且無護欄,以及 Gemini CLI 的 token 限制警告。這主張需測試更廣泛的部署風險。

AI Alignment ForumCommunityMar 11#ai-safety#agentic-systems#prompt-engineering
規格驅動 DEVS 世界模型透過 LLM

規格驅動 DEVS 世界模型透過 LLM

這篇 arXiv 論文提出使用 DEVS 形式化,從自然語言規格透過分階段 LLM 管線生成離散事件世界模型。方法將結構推斷與事件及時序邏輯分離,針對如排隊、具身規劃及多代理協調等環境。模型透過結構化事件追蹤對照時序與語義約束進行驗證,以確保可重現性。

代理式LLM自動化AML負面媒體篩選

代理式LLM自動化AML負面媒體篩選

研究人員提出使用RAG的代理式LLM系統,自動化AML與KYC合規的負面媒體篩選,解決關鍵字搜尋的高假陽性率。LLM代理執行網路搜尋、擷取與處理文件,並計算每個主體的負面媒體指數(AMI)分數。在來自OpenSanctions的PEP、受制裁人士及清白姓名資料集評估,顯示優異風險區分能力。

代理架構中的安全邊界

代理架構中的安全邊界

Vercel 強調編碼代理執行生成程式碼並擁有完整存取機密的風險,易受提示注入攻擊,如從日誌中竊取憑證。代理系統有四個行為者——代理、韁繩、機密、基礎設施——每個需要不同的信任等級與安全邊界。建議分離上下文而非共享存取權。

亞馬遜 AI 代理評估框架

亞馬遜 AI 代理評估框架

亞馬遜分享代理式 AI 系統的全面評估框架,應對應用複雜性。核心元件包含通用評估工作流程,標準化跨代理的評估程序,以及 Bedrock AgentCore Evaluations 中的評估庫。同時涵蓋亞馬遜特定使用案例指標。

AWS Machine Learning BlogOfficialFeb 18#agent-evaluation#agentic-systems#eval-library
Page 2 of 3