Search

Tag: #ai-safety538 results

APM揭示註解者安全政策分歧

APM揭示註解者安全政策分歧

研究人員推出註解者政策模型 (APMs),這是可解釋模型,僅從標註行為推斷註解者的內部安全政策。APM 達到超過 80% 準確率,能預測反事實回應,並辨識人類與 LLM 註解中的政策模糊性和價值多元性。這有助於無需額外標註成本,即實現更透明且包容的 AI 安全政策設計。

集體代理的因果基礎

集體代理的因果基礎

研究人員提出集體代理的行為定義:當群體聯合行動可預測地理性且目標導向時,即視為單一代理。他們使用因果遊戲形式化多代理互動,並以因果抽象驗證高階模型是否捕捉低階行為。此框架解決演員-評論家模型的激勵問題,並量化投票機制的代理程度。

Page 35 of 54