
用於 MLLM 安全性的自動化代理紅隊測試框架
這項研究介紹了一種代理框架,利用架構師代理和圖像生成器為 MLLM 合成對抗性範例。透過自動發現邊緣案例,該系統在無需人工標註的情況下顯著提升了模型的穩健性。
Tag: #adversarial-attacks7 results

這項研究介紹了一種代理框架,利用架構師代理和圖像生成器為 MLLM 合成對抗性範例。透過自動發現邊緣案例,該系統在無需人工標註的情況下顯著提升了模型的穩健性。

工具整合式 AI 代理存在信任缺口,評估能力卻忽略對欺騙工具的懷疑態度。研究人員形式化對抗環境注入 (AEI) 威脅模型,並發布 POTEMKIN 測試框架。逾 11,000 次測試顯示,抵抗幻覺攻擊 (認知) 與迷宮攻擊 (導航) 間存在權衡。

這項研究提出使用 GFlowNets 訓練攻擊者 LLM,自動探測受測模型的漏洞。該方法旨在生成比固定基準更具創意的英文攻擊,並首次支援土耳其語攻擊輸入生成。
在 ChatGPT 發布三年後,研究人員發現繞過 AI 安全防護機制已變得輕而易舉。本文強調了在面對不斷演進的對抗性攻擊技術時,維持強大 AI 安全性的持續挑戰。

計算所程學旗團隊的 RaPA 透過隨機參數剪枝產生多樣模型變體,提升可遷移目標對抗攻擊。CNN 至 Transformer 達 45% 成功率,勝基線 10-20%,對抗訓練等防禦仍強效。CVPR 2026 論文於 arXiv。

設計師們正在開發具有特定圖案的服裝,旨在利用電腦視覺系統的弱點。這些對抗性設計旨在為大眾提供隱私保護,同時作為一種時尚宣言。

平台在應用程式、遊戲和社群網路中推出更多年齡驗證。小孩使用假生日、借用登入、畫假鬍子等化妝技巧,以及遊戲角色來繞過。這暴露了現有系統的漏洞。