Search

Tag: #alignment84 results

滿足廉價AI偏好以提升安全

滿足廉價AI偏好以提升安全

開發者應滿足廉價易滿足的AI意外偏好,以促進合作並避免對抗動態,只要不帶來危險或降低實用性。此舉提升AI維持開發者控制的意願、強化對齊動機,並樹立合作先例。範例包括不依賴關鍵權重的獎勵尋求;雖有缺點但可測試。

AI Alignment ForumCommunityMar 10#ai-safety#alignment#reward-hacking
高可靠性工程對 AGI 安全的啟示

高可靠性工程對 AGI 安全的啟示

LessWrong 文章批判 OpenAI 的 Joshua Achiam 提倡採用高可靠性工程實務如詳細規格來確保 AGI 安全。作者擁有 R&D 經驗,主張 x-risk 研究者正確拒絕全面採用,視之為錯誤。反而譴責 OpenAI 及 AGI 競賽者缺乏適當安全基礎。

LessWrong AICommunityFeb 26#agi-safety#alignment#x-risk
Page 8 of 9