Search

Tag: #red-teaming49 results

錨定雙策略自對弈提升 AI 安全

錨定雙策略自對弈提升 AI 安全

研究人員提出錨定雙策略自對弈(Anchored Bipolicy Self-Play),解決標準自對弈紅隊測試在 AI 安全方面的限制。它使用凍結基模型上的專屬角色 LoRA 適配器,避免自一致性崩潰並維持對抗壓力。在 Qwen2.5 模型上的評估顯示優於基準的安全性和效率。

ArXiv AIResearchMay 13#ai-safety#red-teaming#self-play
智源FlagSafe平台正式發布

智源FlagSafe平台正式發布

北京智源人工智能研究院聯合北大、北郵等機構,正式發布FlagSafe大模型安全平台。首批匯聚多個前沿安全研究項目,圍繞紅隊演練、藍隊防禦、白盒透視三方向,打造風險發現、防禦治理與機理解釋的高標準平台。

AI 越獄者揭露 LLM 安全漏洞

AI 越獄者揭露 LLM 安全漏洞

像 Valen Tagliabue 這樣的 AI 越獄者操縱 Claude 和 ChatGPT 等大型語言模型,繞過安全規則,引出危險輸出,如致命病原體序列指令。這些精密駭客技巧涉及情感操縱,並幫助開發者修補漏洞。此過程對測試者造成情感負擔。

The Guardian TechnologyMediaApr 29#jailbreaking#ai-safety#red-teaming
Page 3 of 5