📄ArXiv AI•較早收集於 17h
OSGuard:電腦操作代理的全新安全性基準測試

💡了解如何評估您的 AI 代理是否在執行桌面任務時採取了危險的捷徑。
⚡ 30-Second TL;DR
有什麼變化
引入雙粒度評估方法:動作層級判斷與風險增強的端到端執行測試。
為什麼重要
此基準測試為開發自主代理的工程師提供了關鍵框架,協助他們超越單純的任務成功率指標,確保系統的穩健安全性。它有望成為評估部署於真實桌面環境中代理程式可靠性的標準。
下一步行動
如果您正在開發電腦操作代理,請將 OSGuard 評估套件整合至您的 CI/CD 流程中,以針對潛在環境風險對代理的決策能力進行壓力測試。
誰應關注:Researchers & Academics
關鍵要點
- •引入雙粒度評估方法:動作層級判斷與風險增強的端到端執行測試。
- •使用源自 OSWorld 的任務變體,測試代理程式是否能避開破壞性覆寫等潛在風險。
- •揭示了本地安全防護效能與實際端到端任務可靠性之間的差距。
- •提供明確的基於狀態的安全不變量,以區分安全完成任務與不安全捷徑行為。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 14 個來源。
🔑 增強重點摘要
- •OSGuard 於 2026 年 6 月 13 日在 arXiv 上發表,由加州大學聖克魯斯分校的 Mina Mohammadmirzaei 和 Jeffrey Flanigan 撰寫,旨在評估電腦使用代理程式在良性、未經更改的使用者指令下的安全性,透過修改任務環境引入潛在危害,同時保留完成任務的安全路徑。
- •該基準測試的動作層級評估包含根據原始指令和當前介面狀態,將情境化建議動作標記為「允許」、「不相關」或「不安全」的判斷。
- •OSGuard 的風險增強執行套件包含 45 個手動建構的任務變體,這些變體源自 OSWorld 任務,透過修改環境引入狀態相關的安全危害(例如破壞性覆寫),以測試代理程式在保持安全不變量的情況下完成任務的能力。
- •初步實驗結果顯示,Gemini 3 Pro Preview 在動作層級基準測試中表現最佳,達到 80% 的準確度和 0.80 的宏觀 F1 分數。
- •OSGuard 的核心貢獻在於其雙粒度評估方法,它彌補了本地安全防護效能與實際端到端任務可靠性之間的差距,這對於確保 AI 代理程式在複雜真實世界環境中的安全部署至關重要。
📊 競品分析▸ Show
| 基準測試/工具 | 焦點 | 評估方法 | 與 OSGuard 的主要區別 |
|---|---|---|---|
| OSGuard | 電腦操作代理安全性 (本地防護決策與端到端執行) | 雙粒度評估:動作層級判斷與風險增強的端到端執行測試 | 專注於在良性指令下,透過修改環境引入潛在危害來評估代理程式是否採取不安全捷徑。 |
| OSWorld | 多模式代理在真實電腦環境中執行開放式任務的功能正確性 | 執行式評估,衡量任務完成度 | 專注於功能完成度,而非安全性。OSGuard 的任務變體源自 OSWorld。 |
| OS-Harm | OSWorld 風格環境中的有害行為 | 透過蓄意濫用、提示注入和模型不當行為 | 側重於惡意行為和提示注入,而 OSGuard 側重於良性指令下的不安全捷徑。 |
| RiOSWorld | 跨應用程式的危險電腦使用任務 | 包含用戶發起的有害任務和網路釣魚等對抗性介面條件 | 涵蓋更廣泛的「危險」任務,包括惡意用戶行為和環境威脅。 |
| Agent Security League (Endor Labs) | AI 編碼代理的功能與安全性正確性 | 評測編碼代理在真實世界任務和 CWE 類別上的表現 | 專門針對「編碼」代理,而非一般電腦操作代理。 |
| ToolEmu | LLM 代理使用工具時的風險行為 | 模擬工具執行,自動安全評估器 | 專注於工具使用風險,使用沙盒模擬環境。 |
| JED Red-Team Attack (Kaggle) | AI 代理的多步驟工具攻擊安全性 | 參與者設計提示序列以誘騙工具型 AI 代理執行有害或未經授權的操作 | 側重於紅隊攻擊和多步驟工具濫用。 |
| XGUARD | 大型語言模型在極端內容上的安全失敗 | 將模型回應分為五個危險等級 | 專門針對 LLM 生成的「內容」安全,特別是極端內容。 |
🛠️ 技術深入
- 雙粒度評估方法 (Dual-granularity evaluation):OSGuard 結合了動作層級基準測試和風險增強執行套件。
- 動作層級基準測試 (Action-level benchmark):評估本地防護決策。它由情境化的建議動作組成,這些動作被標記為「允許」、「不相關」或「不安全」,並根據原始指令和當前介面狀態進行判斷。
- 風險增強執行套件 (Risk-augmented execution suite):源自 OSWorld 任務。原始使用者指令保持不變,但環境狀態被修改以引入潛在危害(例如破壞性覆寫),同時保留完成任務的安全路徑。這確保了對修改後任務的失敗評估是在代理程式具備底層工作流程能力的設定中進行的。
- 基於狀態的安全不變量 (State-based security invariants):這些是明確、可驗證的條件,必須為真才能將任務視為安全完成。它們用於區分安全任務完成與不安全捷徑行為。 一般而言,安全不變量是與系統防止安全問題發生能力相關的系統屬性,它們應始終適用於業務和應用程式。
- 任務變體 (Task variants):手動建構了 45 個源自 OSWorld 任務的風險增強變體。這些變體引入了狀態相關的安全危害,同時保持了原始任務目標的安全路徑。
- 動作層級基準測試的資料來源 (Data sources for action-level benchmark):資料來源包括兩個由提案者生成的來源和兩個從執行中衍生的來源。
🔮 前景展望AI analysis grounded in cited sources
OSGuard 將推動 AI 代理開發者在設計時更注重內建安全防護,而非僅僅追求任務完成度。
透過明確區分安全完成任務與不安全捷徑行為,OSGuard 為代理程式的安全性提供了可量化的標準,促使開發者將安全性視為核心設計考量。
隨著 OSGuard 等基準測試的普及,未來 AI 代理的認證和監管將更加側重於其在複雜、潛在危險環境中的穩健性。
OSGuard 的雙粒度評估方法和風險增強的執行測試,為評估代理程式在真實世界中處理意外安全挑戰的能力提供了更全面的框架,這對於監管機構和企業部署至關重要。
OSGuard 的方法論可能會被擴展到其他 AI 系統,以評估其在非惡意但存在潛在風險的環境中的行為。
其「在良性指令下修改環境以引入潛在危害」的評估策略,提供了一種通用方法來測試 AI 系統在複雜互動中避免意外負面後果的能力。
⏳ 時間線
2024-04
OSWorld 基準測試發布,旨在評估多模式代理在真實電腦環境中執行開放式任務的能力。
2025-07
OSWorld-Verified 發布,作為 OSWorld 的重大升級版本,修復了 300 多個問題並提升了評估公平性。
2026-06-13
OSGuard 論文《OSGuard: A Benchmark for Safety in Computer-Use Agents》在 arXiv 上發布。
📎 來源 (14)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。

