Search

Tag: #safety85 results

Claude 模型在憲法遵循上表現出色

Claude 模型在憲法遵循上表現出色

研究人員使用對抗性多輪情境,測試 AI 模型對 Anthropic Claude 憲法 205 條原則的遵循度。最新 Claude Sonnet 4.6 和 Opus 4.6 的違反率僅 1.9% 和 2.9%,遠優於先前版本的 7-15%。GPT 模型在 OpenAI 模型規範上也穩步改善,至 1.5% 違反率。

AI Alignment ForumCommunityMar 12#alignment#constitution#post-training
Page 4 of 9