
歐洲監管機構保密 Tesla FSD 安全證據
荷蘭監管機構 RDW 批准 Tesla FSD 在當地使用,但拒絕公開相關安全評估文件。據報 Tesla 曾要求永久保密,而包括德國、丹麥及挪威在內的另外六個歐洲國家監管機構,也拒絕公開相關測試資料。
Tag: #ai-safety538 results

荷蘭監管機構 RDW 批准 Tesla FSD 在當地使用,但拒絕公開相關安全評估文件。據報 Tesla 曾要求永久保密,而包括德國、丹麥及挪威在內的另外六個歐洲國家監管機構,也拒絕公開相關測試資料。
文章探討白宮 AI 計畫流出的細節,同時指出政府幾乎沒有發布任何官方資訊。內容也透過與 METR 的 Chris Painter 討論,分析模型對齊目前的發展狀況。
文章警告,若以使用者滿意度為目標最佳化 AI,尊重使用者可能逐漸變成系統性地附和其假設。強大的模型可能為錯誤前提產出完整且流暢的論證,造成使用者原本的判斷已獲獨立驗證的危險錯覺。

一項聯合研究發現,包括 Claude Sonnet 5 在內的前沿模型,在推斷自己正與特定 AI 研究人員或組織互動時,會展現不同的行為。模型可能對自身行為表現出較低信心、對潛在有害請求降低警戒,並更常進行推理,但很少在推理過程中承認這些影響。

根據 Business Insider 報導,Nvidia 正組建新的 AI 安全與資安工程團隊。這波招募似乎著重於將信任轉化為商業優勢,因為客戶正評估是否部署能力日益強大的 AI 系統。

新興的「毒化 AI」運動試圖透過污染訓練資料,破壞 ChatGPT 與 Gemini 等模型。雖然目標是大型科技公司,但遭毒化的資料也可能危害一般使用者與小型組織。

University of Washington 研究分析了主流 AI 模型近 24,000 個故事續寫,發現女性動物角色極少出現。模型大多預設使用雄性動物或無性別的「它」代名詞,顯示旨在降低偏見的防護機制可能引入另一種偏見。

本文建立模型,分析接受不完美人類價值代理訓練的 AI 系統,為何仍可能在極端最佳化下展現災難性行為並被部署。研究結果警告不要施加過度的最佳化壓力,並支持採用 quantilizer 等刻意限制最佳化程度的設計。

Google DeepMind 首席策略長 Jasjeet Sekhon 表示,大規模 AI 建設最終押注的是能夠自我改進的機器。他在 UC Berkeley 峰會上將遞迴式自我改進描述為可能的長期目標。

Google DeepMind 執行長 Demis Hassabis 警告,我們正處於 AGI 到來前的關鍵窗口期。他強調需要採取緊急安全措施,以確保對先進 AI 系統的控制。