
錨定雙策略自對弈提升 AI 安全
研究人員提出錨定雙策略自對弈(Anchored Bipolicy Self-Play),解決標準自對弈紅隊測試在 AI 安全方面的限制。它使用凍結基模型上的專屬角色 LoRA 適配器,避免自一致性崩潰並維持對抗壓力。在 Qwen2.5 模型上的評估顯示優於基準的安全性和效率。
Tag: #self-play5 results

研究人員提出錨定雙策略自對弈(Anchored Bipolicy Self-Play),解決標準自對弈紅隊測試在 AI 安全方面的限制。它使用凍結基模型上的專屬角色 LoRA 適配器,避免自一致性崩潰並維持對抗壓力。在 Qwen2.5 模型上的評估顯示優於基準的安全性和效率。
兩個相同模型的 LLM 代理在程式設計問題上競爭;執行較佳者形成 DPO 對微調,重複循環。純執行獎勵 (通過率),適合本地硬體具專家溫度及記憶整合。早期 Colab A100 結果:HumanEval Pass@1 從 0.671 至 0.683 (+1.2pp)。

MEMO 是一種自我對弈框架,針對多輪多代理 LLM 遊戲優化推斷時上下文,解決變異性和低效能問題。它結合軌跡記憶保留與使用 TrueSkill 的提示演化及優先重播。在五個文字遊戲中,將 GPT-4o-mini 勝率從 25% 提升至 49.5%。
開發者利用自我對弈強化學習,成功打造出達到超人類水準的 Generals.io 遊戲代理程式。該專案採用 JAX 進行高效能模擬,並以 Vision Transformer 取代傳統 CNN 以實現更好的擴展性。
GitHub 上發布了名為 gumbel-mcts 的高效 Python/Numba MCTS 實作。其 PUCT 版本比基準快 2-15 倍,同時政策完全一致。包含密集與稀疏 Gumbel MCTS,適合如西洋棋的大型動作空間與低模擬預算。