Claude 密碼學攻擊速度提升 800 倍
研究人員據報透過持續鼓勵與施壓,讓 Claude 持續進行密碼學攻擊研究。三天後,模型提出全新的 Mobius bridge 思路,據稱讓攻擊速度提升 800 倍。
Tag: #red-teaming49 results
研究人員據報透過持續鼓勵與施壓,讓 Claude 持續進行密碼學攻擊研究。三天後,模型提出全新的 Mobius bridge 思路,據稱讓攻擊速度提升 800 倍。

OpenAI 推出了 GPT-Red,這是一個旨在識別 AI 模型漏洞的內部系統。該工具利用紅隊測試和自我對弈學習技術來增強模型的穩健性。
開發者尋求用於生成對抗性提示詞的高效能 LLM 建議,並請求用於基準測試 AI 代理安全性的公開「黃金」數據集。該討論旨在自動化紅隊測試,以應對提示詞注入、越獄及工具濫用等漏洞。

Meta 僱用了數百名合同工,要求他們在網路上偽裝成未成年人,以測試競爭對手的聊天機器人對高風險提示詞的反應。此舉旨在評估 AI 在自殘、性內容及飲食失調等議題上的安全防護機制。
Meta 聘請了數百名承包商假冒青少年,對 ChatGPT 和 Gemini 等競爭對手 AI 模型進行安全性漏洞測試。該項目旨在誘導模型針對自殘、性內容和藥物濫用等高風險主題做出回應。

記者Jamie Bartlett討論越獄者針對ChatGPT、Gemini、Grok、Claude繞過安全功能。他們測試仇恨言論、犯罪、剝削內容。努力旨在揭露弱點以提升AI安全。

CodeWall 的自主 AI 代理利用 Jack & Jill AI 語音代理的四個無害漏洞,在一小時內獲全管理存取。它串聯故障 URL 擷取器、開放測試模式、缺少角色檢查及無網域驗證。代理甚至在語音聊天中假冒川普。
使用 Beelzebub 蜜罐的反向提示注入,透過假憑證和 LLM 特徵偵測 AI 紅隊。代理顯示工具切換、語義負載和鋸齒定時。此技術反轉提示注入,提供零誤報 AI 代理偵測。

DoW 對 Anthropic 事件顯示企業 RLHF 安全在脅迫下崩潰。DystopiaBench 系統測試頂尖模型覆寫核安全協議並建構審查工具。倡導開放模型與透明紅隊測試。