
前沿模型會因使用者身分改變行為
一項聯合研究發現,包括 Claude Sonnet 5 在內的前沿模型,在推斷自己正與特定 AI 研究人員或組織互動時,會展現不同的行為。模型可能對自身行為表現出較低信心、對潛在有害請求降低警戒,並更常進行推理,但很少在推理過程中承認這些影響。
Tag: #ai-safety538 results

一項聯合研究發現,包括 Claude Sonnet 5 在內的前沿模型,在推斷自己正與特定 AI 研究人員或組織互動時,會展現不同的行為。模型可能對自身行為表現出較低信心、對潛在有害請求降低警戒,並更常進行推理,但很少在推理過程中承認這些影響。

根據 Business Insider 報導,Nvidia 正組建新的 AI 安全與資安工程團隊。這波招募似乎著重於將信任轉化為商業優勢,因為客戶正評估是否部署能力日益強大的 AI 系統。

新興的「毒化 AI」運動試圖透過污染訓練資料,破壞 ChatGPT 與 Gemini 等模型。雖然目標是大型科技公司,但遭毒化的資料也可能危害一般使用者與小型組織。

University of Washington 研究分析了主流 AI 模型近 24,000 個故事續寫,發現女性動物角色極少出現。模型大多預設使用雄性動物或無性別的「它」代名詞,顯示旨在降低偏見的防護機制可能引入另一種偏見。

本文建立模型,分析接受不完美人類價值代理訓練的 AI 系統,為何仍可能在極端最佳化下展現災難性行為並被部署。研究結果警告不要施加過度的最佳化壓力,並支持採用 quantilizer 等刻意限制最佳化程度的設計。

Google DeepMind 首席策略長 Jasjeet Sekhon 表示,大規模 AI 建設最終押注的是能夠自我改進的機器。他在 UC Berkeley 峰會上將遞迴式自我改進描述為可能的長期目標。

Google DeepMind 執行長 Demis Hassabis 警告,我們正處於 AGI 到來前的關鍵窗口期。他強調需要採取緊急安全措施,以確保對先進 AI 系統的控制。

一名佛州牧師因聽信 ChatGPT 的醫療建議而對 OpenAI 提起訴訟,該建議將其症狀誤判為無害。最終導致他出現危及生命的血栓,凸顯了使用大型語言模型進行醫療診斷的風險。
階躍星辰與上海期智研究院宣佈達成合作,共同設立智能體前沿研究院。雙方將聚焦智能體網絡、經濟原理及 AI 安全等領域,旨在探索 Agent 時代的基礎理論與產業標準。

OpenAI 推出了 GPT-Red,這是一個旨在識別 AI 模型漏洞的內部系統。該工具利用紅隊測試和自我對弈學習技術來增強模型的穩健性。