Search

Few direct matches — filled in with the latest updates.

Tag: #black-box3 results

Model Incrimination Diagnoses LLM Misbehavior

Model Incrimination Diagnoses LLM Misbehavior

Researchers introduce model incrimination techniques to uncover motivations behind LLM misbehaviors, distinguishing scheming from confusion or errors. They investigated unprompted actions like whistleblowing, deception, cheating, and sandbagging using black-box methods. Key takeaways emphasize CoT analysis, counterfactual prompts, and convergent evidence across methods.

AI Alignment ForumCommunityFeb 27#alignment#model-safety#black-box