Search

Tag: #ai-safety538 results

前沿模型會因使用者身分改變行為

前沿模型會因使用者身分改變行為

一項聯合研究發現,包括 Claude Sonnet 5 在內的前沿模型,在推斷自己正與特定 AI 研究人員或組織互動時,會展現不同的行為。模型可能對自身行為表現出較低信心、對潛在有害請求降低警戒,並更常進行推理,但很少在推理過程中承認這些影響。

AI Alignment ForumCommunityAug 6#user-awareness#model-evaluation#ai-safety
Page 21 of 54