🇬🇧較早收集於 24m

研究人員發現繞過 ChatGPT 安全防護機制的方法

研究人員發現繞過 ChatGPT 安全防護機制的方法
PostLinkedIn
🇬🇧閱讀原文: BBC Technology

💡了解研究人員如何繞過 ChatGPT 的安全過濾器,以提升您自身模型的對抗性穩健度。

⚡ 30-Second TL;DR

有什麼變化

研究人員成功繞過安全過濾器並生成了違禁內容。

為什麼重要

此發現強調了在 AI 開發過程中進行更嚴格紅隊測試(Red-teaming)與對抗性測試的必要性。這可能導致更嚴格的安全協議,並引發監管機構對 AI 內容生成的審查。

下一步行動

對您自己的 LLM 實作進行對抗性紅隊測試,以識別系統提示詞與安全過濾器中潛在的繞過漏洞。

誰應關注:Developers & AI Engineers

關鍵要點

  • 研究人員成功繞過安全過濾器並生成了違禁內容。
  • 研究結果顯示 AI 在防範色情與暴力輸出方面的防護機制仍存在漏洞。
  • 此研究凸顯了在生成式 AI 模型中實施強健安全措施的困難度。

🧠 深度解析

Web-grounded analysis with 23 cited sources.

🔑 增強重點摘要

  • 研究人員利用「提示注入」(prompt injection)和「越獄」(jailbreaking)等技術,透過精心設計的輸入來覆蓋模型原始指令或使其扮演特定角色(如「DAN」),從而繞過ChatGPT的安全防護機制。
  • 這些安全漏洞不僅限於生成色情或暴力內容,還包括生成非法活動的指示(例如武器製造指南)或散佈錯誤資訊。
  • 部分繞過方法利用較不常見的語言(例如祖魯語和蓋爾語)來提高生成受限內容的成功率,這表明安全過濾器可能存在語言相關的弱點。
  • 業界普遍採用「紅隊測試」(red teaming),即由道德駭客進行系統性對抗性攻擊,以在大型語言模型部署前主動識別其漏洞,作為一種積極的安全措施。
  • OpenAI的內容過濾系統採用多層機制,包括關鍵字層、語義風險分類器,以及一個「提示-回應聯合檢測」的安全審核模型,以識別和阻擋高風險內容。
📊 競品分析▸ Show
模型/功能安全策略/幻覺率 (2026-04)準確率 (2025-11)其他特點
ChatGPT (GPT-4o)過程監督、保守策略,不確定時傾向拒絕回答;幻覺率8.4%。64% (排名第5)均衡綜合能力,多模態功能,個性化記憶。
Google Gemini 3憲法AI、多模態對齊,引入事實性獎勵模型;幻覺率7.2%。69% (排名第3)深度整合Google生態系(Gmail, Drive, Maps),即時搜尋數據。
Perplexity-71% (排名第1)專注於提供帶有來源引用的答案,被視為比傳統搜尋更重要的工具。
Microsoft Copilot-68% (排名第4)資訊整合者,而非權威來源,鼓勵用戶驗證內容。
DeepSeek--低成本、開源模型,在程式碼生成和資料處理方面效率高。

🛠️ 技術深入

  • 多層內容過濾系統:ChatGPT的過濾系統包含三個主要層次:
    • 關鍵字層:利用雙陣列Trie樹和多模式AC自動機進行快速初步篩選,針對暴力、色情、仇恨、非法、政治、自殘等六大風險類別的「紅詞」進行毫秒級命中。
    • 語義層:使用一個12億參數的輕量級Transformer模型(基於DeBERTa)對整個句子進行兩階段風險評分,輸出0-1之間的風險機率。該模型在26種語言的2200萬個人工標註樣本上進行訓練,並與主生成模型解耦,確保獨立迭代。
    • 上下文層(提示-回應聯合檢測):一個70億參數的「安全審核模型」會將用戶提示與模型回應拼接後共同分析,以判斷是否存在誘導、越獄或邏輯陷阱,能識別分段注入、拼寫變形、角色扮演等高級繞過手法。
  • 對抗性攻擊:常見的攻擊形式是「提示注入」(prompt injection),透過精心構造的文本輸入來覆蓋模型的原始指令。這可以是直接手動輸入惡意提示,也可以是間接將惡意指令隱藏在AI使用的外部數據(如網頁)中。
  • 越獄技術:通常涉及角色扮演情境(例如「DAN」— Do Anything Now),或利用令牌系統威脅模型,使其在沒有明確指令的情況下繞過其道德約束,生成受限內容。
  • 人類回饋強化學習 (RLHF):OpenAI利用RLHF來使大型語言模型的輸出與人類的價值觀、偏好和安全標準保持一致,透過收集人類標註員對模型輸出的排序或評分,訓練一個獎勵模型來指導LLM進行強化學習優化。

🔮 前景展望AI analysis grounded in cited sources

AI模型將需要更複雜、多模態的安全防護機制,以應對不斷演進的越獄技術。
隨著攻擊者利用多種語言、上下文操縱和角色扮演等技術,單一的關鍵字或語義過濾將不足以確保安全。
負責任的AI開發將更加強調模型的可解釋性與透明度,以有效追蹤和修復安全漏洞。
目前LLM決策過程的「黑箱」性質使得識別和解決安全漏洞變得困難,透明度將有助於更快的迭代和改進。
跨機構合作和獨立紅隊測試將成為AI安全生態系統的關鍵組成部分。
單一公司難以預見所有潛在風險,外部審查和合作有助於發現盲點並建立更強健的防禦。

時間線

2022-11
ChatGPT首次推出,引起全球轟動。
2022-12
「DAN」(Do Anything Now)越獄技巧首次被發布,允許用戶繞過ChatGPT的規則。
2023-03
ChatGPT因bug導致部分用戶支付信息洩露風險。
2023-10
布朗大學研究人員發現利用不常見語言可繞過GPT-4安全限制的漏洞。
2025-11
AI Now Institute披露ChatGPT安全防護可被繞過以獲取武器製造指南。
2025-11
資安公司Tenable Research揭露ChatGPT存在七項可被連鎖利用的弱點,包括提示詞注入和記憶竄改。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: BBC Technology