📄最新收集於 15h

DiSCO 為文字生成圖像加入黑箱安全防護

DiSCO 為文字生成圖像加入黑箱安全防護
PostLinkedIn
📄閱讀原文: ArXiv AI

💡了解無需存取模型內部,如何透過模型無關的提示詞防禦降低有害圖像生成攻擊。

⚡ 30-Second TL;DR

有什麼變化

完全在提示詞層級運作,不需要模型重新訓練、微調或存取內部資訊。

為什麼重要

DiSCO 可為不公開模型權重或推論控制項的專有文字生成圖像 API,提供實用的安全防護層。其即插即用設計可能降低部署安全機制的門檻,但實務團隊仍應驗證延遲、成本,以及對自適應攻擊者的韌性。

下一步行動

將 DiSCO 原型化為文字生成圖像 API 外部的提示詞中介層,並使用類似 I2P 的對抗提示詞評估安全性、語意保真度、延遲與 token 成本。

誰應關注:Researchers & Academics

關鍵要點

  • 完全在提示詞層級運作,不需要模型重新訓練、微調或存取內部資訊。
  • 透過束搜尋進行後綴擴展,並使用目標模型生成的安全與不安全圖像進行對比評分。
  • 針對「良性對抗」問題:提示詞在語言上安全,卻仍可能觸發有害圖像。
  • 在 I2P 測試中,將未防護模型的攻擊成功率降低 37.7%,已防護模型則降低 25.13%。
  • 在多種紅隊攻擊下維持語意保真度,同時提升圖像一致性。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • DiSCO 的核心機制依賴於一種稱為「分佈導向提示詞最佳化」(Distribution-Guided Prompt Optimization)的技術,旨在解決文字生成圖像模型中隱含的有害偏見。
  • 該研究指出,現有的安全過濾器(如基於 CLIP 的分類器)往往無法識別語意上良性但視覺上具攻擊性的提示詞,DiSCO 填補了這一防禦缺口。
  • DiSCO 在最佳化過程中引入了對比學習(Contrastive Learning)概念,透過計算安全與不安全圖像池的嵌入距離,動態調整提示詞後綴以遠離有害區域。
  • 研究團隊發現,DiSCO 的防禦效果在不同模型架構(如 Stable Diffusion 系列)之間具有良好的遷移性,無需針對特定模型進行架構調整。
  • 該方法在保持圖像生成品質與提示詞語意一致性方面表現優異,解決了傳統對抗性防禦往往導致圖像品質顯著下降的問題。
📊 競品分析▸ Show
特性DiSCOAdvPrompterSafeLatent
防禦類型黑箱/提示詞最佳化提示詞生成/微調模型權重/潛空間干預
需模型存取
效能影響
基準測試I2PI2P/AdvBenchI2P

🛠️ 技術深入

  • 演算法核心:利用束搜尋(Beam Search)在提示詞空間中進行離散搜尋,尋找能最大化安全機率的後綴序列。
  • 對比評分機制:定義一個安全圖像池(Safe Pool)與不安全圖像池(Unsafe Pool),透過計算提示詞生成圖像與兩者之間的餘弦相似度差異來作為最佳化目標。
  • 零樣本特性:不依賴於目標模型的梯度資訊,僅透過模型輸出的圖像進行回饋,使其適用於閉源 API 模型。
  • 語意保真度:在最佳化過程中加入語意一致性約束,確保添加的後綴不會改變使用者原始提示詞的核心意圖。

🔮 前景展望AI analysis grounded in cited sources

黑箱提示詞防禦將成為 API 圖像生成服務的標準安全層。
由於無法存取閉源模型的內部權重,這種無需微調的提示詞最佳化方法是目前保護商業模型最可行的方案。
對抗性提示詞攻擊與防禦將演變為自動化的動態博弈。
隨著 DiSCO 等自動化防禦工具的普及,攻擊者將被迫開發更複雜的動態提示詞注入技術,推動防禦機制持續迭代。

時間線

2024-05
DiSCO 研究論文首次於 ArXiv 發布,提出零樣本黑箱防禦框架。
2024-08
DiSCO 在 I2P 基準測試中驗證其降低有害內容生成率的有效性。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI