Search

Tag: #agi-safety10 results

對齊概念:有缺陷的抽象

對齊概念:有缺陷的抽象

本文批判AI對齊概念如賦權與可修正性,為根植於自由意志與可操縱目標的不連貫人類直覺的簡單抽象。它檢視定義非操縱AI行為的方法,但結論無一提供技術對齊的有用「真名」。作者將此置於其腦狀AGI安全研究脈絡,使用同情與認可獎勵。

AI Alignment ForumCommunityMay 11#ai-alignment#manipulation#corrigibility
高可靠性工程對 AGI 安全的啟示

高可靠性工程對 AGI 安全的啟示

LessWrong 文章批判 OpenAI 的 Joshua Achiam 提倡採用高可靠性工程實務如詳細規格來確保 AGI 安全。作者擁有 R&D 經驗,主張 x-risk 研究者正確拒絕全面採用,視之為錯誤。反而譴責 OpenAI 及 AGI 競賽者缺乏適當安全基礎。

LessWrong AICommunityFeb 26#agi-safety#alignment#x-risk