Search

Tag: #model-safety45 results

模型歸罪診斷 LLM 誤行為

模型歸罪診斷 LLM 誤行為

研究人員提出模型歸罪技術,用以揭露 LLM 誤行為背後動機,區分陰謀與混亂或錯誤。他們使用黑盒方法調查自發行為,如告密、欺騙、作弊與沙袋戰。主要心得強調 CoT 分析、反事實提示及多方法匯聚證據。

AI Alignment ForumCommunityFeb 27#alignment#model-safety#black-box
Page 3 of 5