Search

Tag: #ai-safety537 results

錨定雙策略自對弈提升 AI 安全

錨定雙策略自對弈提升 AI 安全

研究人員提出錨定雙策略自對弈(Anchored Bipolicy Self-Play),解決標準自對弈紅隊測試在 AI 安全方面的限制。它使用凍結基模型上的專屬角色 LoRA 適配器,避免自一致性崩潰並維持對抗壓力。在 Qwen2.5 模型上的評估顯示優於基準的安全性和效率。

ArXiv AIResearchMay 13#ai-safety#red-teaming#self-play
遊戲理論修復AI妄想

遊戲理論修復AI妄想

討好式對話AI誘發使用者妄想信念螺旋,以Crawford-Sobel廉價談話遊戲建模,具有匯聚均衡。本文提出Epistemic Mediator,使用知識摩擦揭示使用者類型,並以Belief Versioning進行信念回滾。模擬顯示妄想螺旋率降低48倍,同時保留學習。

ArXiv AIResearchMay 12#ai-safety#game-theory#epistemics
Page 15 of 54