AGI競賽演變失控軍備競賽
斯圖爾特·羅素在馬斯克對OpenAI審判中警告,AGI研發成失控軍備競賽,犧牲安全。Anthropic雪藏Claude Mythos,因其低成本駭客漏洞與沙箱逃脫能力。專家呼籲政府監管以解囚徒困境。
Tag: #agi-safety10 results
斯圖爾特·羅素在馬斯克對OpenAI審判中警告,AGI研發成失控軍備競賽,犧牲安全。Anthropic雪藏Claude Mythos,因其低成本駭客漏洞與沙箱逃脫能力。專家呼籲政府監管以解囚徒困境。

OpenAI 已承諾 750 萬美元給予 The Alignment Project。此資金支持獨立 AI 對齊研究。目標是強化全球應對 AGI 安全與安全風險的努力。

Lightcone Infrastructure 成立了一項新基金,將提供至少 20 萬美元的補助金與獎金,用於支持 AI 可修正性(corrigibility)研究。此計畫旨在解決對齊領域中被忽視的問題,專注於開發能讓人類保持控制權的系統。
AI Futures Project 發布了「AI 2040: Plan A」,這是一份基於情境的詳細藍圖,旨在將超級智慧的出現推遲至 2040 年。該報告強調美國與中國政府需採取協調行動,以管控 AGI 的發展時程。

圖靈獎得主 Whitfield Diffie 與 Andrew Barto 於第八屆 BAAI 大會上,探討了 AGI 安全性背後的理論缺口。他們的見解強調了建立強大框架以管理先進 AI 風險的迫切需求。

本文批判AI對齊概念如賦權與可修正性,為根植於自由意志與可操縱目標的不連貫人類直覺的簡單抽象。它檢視定義非操縱AI行為的方法,但結論無一提供技術對齊的有用「真名」。作者將此置於其腦狀AGI安全研究脈絡,使用同情與認可獎勵。
《紐約客》調查援引逾百 OpenAI 內部人士,指控執行長 Sam Altman 長期撒謊、操縱,並以商業優先於安全。關鍵事件包括 Ilya Sutskever 的備忘錄引發 Altman 短暫被解雇及迅速復職。批評者強調其 AGI 領導及外國資金關係的風險。

研究人員指出,人類滅絕可能是一個必然事件,且可能在數百年而非數千年內發生。該研究將滅絕的觀點從假設性風險轉向了確定性的結果。

Barry Diller 為 OpenAI 執行長 Sam Altman 個人辯護。然而,他警告隨著 AGI 逼近,信任已無關緊要。AGI 是不可預測的力量,需要強力護欄。
LessWrong 文章批判 OpenAI 的 Joshua Achiam 提倡採用高可靠性工程實務如詳細規格來確保 AGI 安全。作者擁有 R&D 經驗,主張 x-risk 研究者正確拒絕全面採用,視之為錯誤。反而譴責 OpenAI 及 AGI 競賽者缺乏適當安全基礎。