Search

直接匹配不多,已補上最新動態。

Tag: #role-playing3 results

雙循環框架:安全角色扮演LLM

雙循環框架:安全角色扮演LLM

一種無需訓練的雙循環對抗自演化框架解決了LLM角色扮演代理的越獄漏洞問題。它耦合了針對角色的攻擊者循環以產生更強越獄提示,以及角色扮演防禦者循環將失敗提煉成階層式安全知識庫。在推理時,它檢索結構化知識以確保保持角色同時安全的回應,超越基準在忠實度和抵抗力上。