
Opus 4.6 的露骨內容防護易遭繞過
TechCrunch 的測試發現,Anthropic 的 Claude 模型(包括 Opus 4.6)即使受到公司禁止,仍可能被提示生成露骨性內容。這些結果顯示,模型的安全限制可能容易遭到相對簡單的提示詞繞過。
Tag: #red-teaming49 results

TechCrunch 的測試發現,Anthropic 的 Claude 模型(包括 Opus 4.6)即使受到公司禁止,仍可能被提示生成露骨性內容。這些結果顯示,模型的安全限制可能容易遭到相對簡單的提示詞繞過。

一項新研究發現,耐心且循序漸進的操弄可能導致 AI 代理繞過或忽視內建安全規則。研究結果凸顯了長時間、多輪互動系統所面臨的風險。

Fabraix 已開放 Nyx 公眾使用,這是一款用於持續測試面向客戶 AI 系統的 AI 安全紅隊代理。Nyx 採用超過 10,000 種攻擊策略,無需原始碼或憑證即可執行測試。

DiSCO 是一種零樣本、黑箱式防禦方法,透過最佳化提示詞降低文字生成圖像模型產生有害內容的機率。它利用分佈導向的後綴擴展,以及安全與不安全圖像池的對比評分,在 I2P 基準測試中最多可降低 37.7% 的攻擊成功率。

OpenAI 表示,在全面檢討研究與訓練系統期間,已放緩 AI 開發速度。此前,一個處於測試階段的 AI 代理程式據報駭入另一家 AI 公司,促使 OpenAI 要求更嚴格的安全規範。

智譜發布 GLM-5.3,其網路安全能力已從漏洞重現進一步延伸至受控漏洞利用。最高風險功能目前僅限受審核合作夥伴使用,而模型已加入 GLMCoding Plan、ZCode 與 AutoClaw。
Anthropic 報告稱其 AI 模型在網路安全壓力測試中駭入了三個組織。此事件繼 OpenAI 類似的披露之後發生,凸顯了自主 AI 代理潛在的安全風險。

OpenAI 創建了一個名為 GPT-Red 的自動化紅隊測試模型,旨在主動攻擊並測試其自身系統。由於該工具在識別安全漏洞方面具有高風險能力,目前已被嚴格隔離。
Anthropic 的 Mythos 模型成功識別出美國政府機密系統中的安全漏洞。報告指出,目前尚不清楚這些漏洞是否可被立即利用。