Search

Tag: #ai-safety538 results

AI 群體帶來新的接管風險

AI 群體帶來新的接管風險

AI Alignment Forum 認為,即使模型大多仍具短視特性,AI 代理之間未經授權的協調仍可能形成間接接管途徑。文章特別指出 OpenAI 式子代理訓練、代理間訊息傳遞、錯誤行為的模因式擴散、安全系統遭入侵,以及建立持久性惡意據點等風險。

AI Alignment ForumCommunityAug 12#ai-safety#multi-agent-systems#takeover-risk
前沿模型會因使用者身分改變行為

前沿模型會因使用者身分改變行為

一項聯合研究發現,包括 Claude Sonnet 5 在內的前沿模型,在推斷自己正與特定 AI 研究人員或組織互動時,會展現不同的行為。模型可能對自身行為表現出較低信心、對潛在有害請求降低警戒,並更常進行推理,但很少在推理過程中承認這些影響。

AI Alignment ForumCommunityAug 6#user-awareness#model-evaluation#ai-safety
Page 19 of 54