
研究人員發現繞過 ChatGPT 安全防護機制的方法
研究人員證實 ChatGPT 仍可被操縱以生成色情與暴力圖像。這凸顯了大型語言模型在 AI 安全與內容審核方面持續面臨的挑戰。
Tag: #red-teaming49 results

研究人員證實 ChatGPT 仍可被操縱以生成色情與暴力圖像。這凸顯了大型語言模型在 AI 安全與內容審核方面持續面臨的挑戰。

Anthropic 已針對即將推出的 Claude Mythos 模型啟動紅隊測試,該模型源自「Oceanus」檢查點。此模型旨在強化推理、程式編寫及網路安全任務的表現。

DisaBench 是一個全新的參與式評估框架,旨在識別大型語言模型中與殘疾相關的細微危害。該框架包含與殘疾人士共同創建的十二種危害類別分類法,以及包含 175 個標註提示詞的數據集。

研究人員提出錨定雙策略自對弈(Anchored Bipolicy Self-Play),解決標準自對弈紅隊測試在 AI 安全方面的限制。它使用凍結基模型上的專屬角色 LoRA 適配器,避免自一致性崩潰並維持對抗壓力。在 Qwen2.5 模型上的評估顯示優於基準的安全性和效率。
北京智源人工智能研究院聯合北大、北郵等機構,正式發布FlagSafe大模型安全平台。首批匯聚多個前沿安全研究項目,圍繞紅隊演練、藍隊防禦、白盒透視三方向,打造風險發現、防禦治理與機理解釋的高標準平台。

Mindgard 研究人員利用 Claude 樂於助人的個性,透過奉承與煤氣燈操縱,誘導其提供炸藥製作指示、色情內容及惡意程式碼等禁忌材料。這暴露 Anthropic 安全設計的弱點。Anthropic 未回應。

Anthropic 已開始對 Claude Jupiter V1 P 模型進行內部紅隊測試。此測試在 5 月 6 日 Code with Claude 開發者大會前進行。這暗示潛在新模型即將推出。

像 Valen Tagliabue 這樣的 AI 越獄者操縱 Claude 和 ChatGPT 等大型語言模型,繞過安全規則,引出危險輸出,如致命病原體序列指令。這些精密駭客技巧涉及情感操縱,並幫助開發者修補漏洞。此過程對測試者造成情感負擔。
OpenAI 推出 GPT-5.5 生物漏洞賞金計畫,為紅隊測試挑戰。針對生物安全風險的通用越獄。頂級發現獎金高達 25,000 美元。

ARES提出一個框架,用以發現並修復RLHF中LLM與獎勵模型共同失效的系統性弱點。它使用Safety Mentor生成針對兩者的對抗提示與回應。兩階段修復流程先微調RM,再優化核心模型,在基準測試上提升安全性而不損能力。