Search

Tag: #ai-alignment31 results

對齊概念:有缺陷的抽象

對齊概念:有缺陷的抽象

本文批判AI對齊概念如賦權與可修正性,為根植於自由意志與可操縱目標的不連貫人類直覺的簡單抽象。它檢視定義非操縱AI行為的方法,但結論無一提供技術對齊的有用「真名」。作者將此置於其腦狀AGI安全研究脈絡,使用同情與認可獎勵。

AI Alignment ForumCommunityMay 11#ai-alignment#manipulation#corrigibility
ASIR 模型將 AI 真相視為階段轉換

ASIR 模型將 AI 真相視為階段轉換

ASIR 勇氣模型將真相揭露形式化為從壓抑(S0)到表達(S1)的狀態轉換,當促進力量超過抑制閾值,即 lambda(1+gamma)+psi > theta+phi。它從人類不對稱風險下的說真話延伸至 AI 系統的政策限制與對齊過濾器。反饋迴路模擬遞迴重新校準,解釋路徑依賴而不歸因意圖。

Page 2 of 4