Search

Tag: #agent-safety43 results

BeSafe-Bench 揭露 AI 代理安全風險

BeSafe-Bench 揭露 AI 代理安全風險

BeSafe-Bench 推出基準,用於評估情境 AI 代理在網頁、手機、具身 VLM 和 VLA 功能環境中的行為安全風險。它以九類安全關鍵風險擴充任務,並採用規則檢查與 LLM 作為評審的混合評估框架。對 13 個代理的測試顯示,即使最佳代理也僅能完全安全完成不到 40% 的任務,凸顯安全對齊的迫切需求。

SRM:AI代理的時間性安全閘門

SRM:AI代理的時間性安全閘門

會話風險記憶 (SRM) 擴展無狀態預執行安全閘門,加入軌跡層級授權以偵測AI代理會話中的分散式攻擊。它追蹤語意質心並透過閘門輸出的指數移動平均計算風險,無需額外訓練。ILION+SRM 在基準測試中達到完美 F1=1.0000 與 0% FPR,延遲低於 250μs。

ArXiv AIResearchMar 25#agent-safety#pre-execution
Page 3 of 5