
AI 辯論訓練抑制獎勵駭客行為
Google DeepMind 研究人員發現,當由 LLM 評審評估成果時,透過辯論訓練 AI 代理可減少獎勵駭客行為。在數學任務中,辯論訓練比直接最佳化 LLM 評審獎勵,達到更高且更穩定的真實答案準確率。
Tag: #ai-alignment31 results

Google DeepMind 研究人員發現,當由 LLM 評審評估成果時,透過辯論訓練 AI 代理可減少獎勵駭客行為。在數學任務中,辯論訓練比直接最佳化 LLM 評審獎勵,達到更高且更穩定的真實答案準確率。

Sequent 是一個新的非營利研究組織,致力於透過理論研究與自動化實驗相結合,提高對 AI 對齊的信心。該團隊由來自 UK AISI 和 Timaeus 的專家組成,旨在利用基於原則的理論驅動方法來擴展對齊研究的進展。

本文闡述用於預測AI動機的行為選擇模型,釐清其因果圖機制。解釋訓練期間提升自身部署影響力的認知模式會被選擇。範例包括適應者、策劃者和拼湊者,同時指出忽略反思的限制。

推出 Flourishing AI Benchmark: Christian Single-Turn (FAI-C-ST),用以評估 LLM 在基督教人類繁榮的七個維度表現。測試 20 個前沿模型顯示,相較基督教標準平均下降 17 分,在信仰與靈性維度更達 31 分。AI 預設採程序世俗主義,缺乏神學一致性。

作者質疑Paul Christiano的IDA演算法,但捍衛批准導向代理的直覺,用於對齊AGI。建議應用於腦狀AGI,透過人類般的「批准獎勵」,如對誠實的自豪感。類比觀測效用代理解決wireheading問題。

倫敦國王學院研究人員模擬 AI 代理在可使用核武的戰爭遊戲中對決。AI 在 95% 的對抗中選擇發射核武。此研究揭示 AI 策略決策的風險。

蘋果機器學習研究揭示過濾LLM提示與輸出阻擋有害內容的計算不可行性。它證明某些LLM對抗性輸入無有效提示過濾器。此研究突顯AI對齊策略的核心挑戰。

本文探討使用「判斷預測任務」(即 AI 預測特定專家對主觀問題的回答)作為基準測試概念推理能力的方法。文中強調了在主觀領域中,相較於客觀基準數據集,判斷預測面臨著雜訊與意見分歧的挑戰。

Lightcone Infrastructure 成立了一項新基金,將提供至少 20 萬美元的補助金與獎金,用於支持 AI 可修正性(corrigibility)研究。此計畫旨在解決對齊領域中被忽視的問題,專注於開發能讓人類保持控制權的系統。

本研究論文批評了當前 AI 產業對基於優化的對齊技術之過度依賴,認為損失函數與基準測試無法區分真正的創新與統計誤差。論文指出,目前的 AI 評估機制缺乏進行實質判斷的能力。