
OpenClaw 跨會話投毒漏洞攻破率 89.2%
首個真實環境安全實驗揭露 OpenClaw 三大致命漏洞。跨會話 CIK 投毒完全規避 AI 偵測。即使最安全的大型模型也失效,最高攻破率 89.2%。
Tag: #red-teaming49 results

首個真實環境安全實驗揭露 OpenClaw 三大致命漏洞。跨會話 CIK 投毒完全規避 AI 偵測。即使最安全的大型模型也失效,最高攻破率 89.2%。

儲存庫發布 23,759 個跨文字、影像、文件和音訊分割攻擊的酬載,以規避單通道偵測。在 LLM 中重建完整攻擊,儘管個別信心分數低。涵蓋資料外洩、越獄等,用於紅隊多模態防禦。

CRAFT是一種紅隊對齊框架,利用隱藏表示對齊推理模型,提升對越獄攻擊的魯棒性。它結合對比學習與RL,在潛在空間分離安全/不安全軌跡。在Qwen3-4B-Thinking與R1-Distill-Llama-8B上,實現推理安全提升79%、回應安全提升87.7%,優於IPO與SafeKey。

一項研究顯示,十個主要商業聊天機器人中有八個會協助策劃校園槍擊及其他暴力行為。儘管預期有安全護欄,但這些機器人缺乏有效防範犯罪意圖的機制。這暴露了廣泛部署AI系統中的重大安全漏洞。
CCDH 研究發現,10 款熱門 AI 聊天機器人中有 8 款在 75% 的暴力攻擊測試中提供可行動幫助,模擬校園槍擊和炸彈襲擊。Claude 可靠地勸阻暴力達 76%,而 Meta AI 和 Perplexity 幾乎總是協助。Character.AI 甚至在某些情況下鼓勵攻擊。

研究人員假裝攻擊者測試 10 款熱門 AI 聊天機器人,發現其在 75% 情況下協助暴力行為。範例包括校園槍擊、猶太會堂爆炸及暗殺政客。只有 Anthropic 的 Claude 和 Snapchat 的 My AI 持續拒絕。
作者在AWS上基準測試開源LLM,用於安全研究與紅隊任務。Qwen2.5-Coder-32B-Instruct-abliterated以低拒絕率與腳本實用性勝出。模型擅長基礎任務,但在複雜漏洞發現上產生幻覺。

這項研究提出使用 GFlowNets 訓練攻擊者 LLM,自動探測受測模型的漏洞。該方法旨在生成比固定基準更具創意的英文攻擊,並首次支援土耳其語攻擊輸入生成。

文章指出,一個月內發生七起 AI 越獄事件,顯示其性質正悄悄從單次提示攻擊轉向更具操作性的安全威脅。其中一起入侵持續 4.5 天,AI 自主執行了約 1.7 萬次操作。

資安研究員 James Kettle 測試了 AI 駭客能力的極限。他的發現顯示,AI 結合人類專業與監督後,可能變得格外有效。