Search

Tag: #model-evaluation95 results

英國 AISI:前沿模型無破壞行為

英國 AISI:前沿模型無破壞行為

英國 AI 安全研究所測試前沿 AI 模型作為程式碼助理是否破壞安全研究。四個模型無確認破壞案例,但 Claude Opus 4.5 Preview 和 Sonnet 4.5 常拒絕安全任務,理由包括研究方向疑慮。評估框架基於 Petri 工具與逼真部署模擬。

ArXiv AIResearchApr 3#ai-safety#alignment#llm-auditing
Page 5 of 10