來源AI Alignment Forum•較早收集於 14m
全新 20 萬美元 AI 可修正性研究基金正式啟動

#ai-alignment#agi-safety#grantscorrigibility-research-fundlightcone infrastructure
獲取專注於可修正性與人機協作安全架構的 AI 對齊研究專屬資金。
30 秒速覽
有什麼變化
該基金將於 2026 年透過傳統補助金與現有研究獎項發放 20 萬美元。
為什麼重要
此基金為專注於構建可修正 AI 代理的理論與實踐挑戰的研究人員提供了難得的財務激勵,有望加速安全 AGI 的發展進程。
下一步行動
如果您正在進行對齊研究,請在 8 月 23 日截止日期前將您的專案提案發送至 grants@corrigibilityresearch.org。
誰應關注:Researchers & Academics
關鍵要點
- •該基金將於 2026 年透過傳統補助金與現有研究獎項發放 20 萬美元。
- •可修正性被視為比直接灌輸價值更安全的替代方案,重點在於讓人類保持決策主導權。
- •首輪補助金申請截止日期為 8 月 23 日,需透過電子郵件提交。
- •該基金由 AI 對齊領域專家管理,並由 Lightcone Infrastructure 託管。
深度解析
本篇為 AI 生成分析,非原文內容。
增強重點摘要
- •該基金的資金來源部分歸功於 Lightcone Infrastructure 營運的 LessWrong 社群與相關捐贈者的長期支持,旨在填補 AI 安全研究中針對『可修正性』這一特定技術缺口的資助空白。
- •此計畫特別強調『代理人可修正性』(Agent Corrigibility),即研究如何確保 AI 系統在面對人類干預、關閉請求或目標修正時,不會產生抵抗行為或策略性欺騙。
- •Lightcone Infrastructure 過去曾透過其平台舉辦多次 AI 安全相關的黑客松與研究競賽,此次基金設立是將這些零散的社群活動轉化為結構化研究資助的重要里程碑。
- •該基金評審委員會成員包括多位在 AI 對齊論壇(AI Alignment Forum)活躍的獨立研究員,他們傾向於資助那些具備高理論深度但尚未獲得主流學術機構青睞的早期研究。
- •除了 20 萬美元的初始資金,該計畫還提供獲選者進入 Lightcone 內部研究網絡的機會,以便與其他致力於對齊問題的工程師進行技術交流與代碼審查。
技術深入
- 可修正性研究的核心技術挑戰在於定義『效用函數的穩定性』,即如何在不破壞 AI 原始目標的前提下,允許人類修改其行為參數。
- 研究重點包含『關閉按鈕問題』(The Off-Switch Problem),即設計數學模型確保 AI 系統在預期到關閉行為時,不會為了達成目標而主動阻止人類執行關閉指令。
- 探討『影響力最小化』(Impact Minimization)技術,透過懲罰 AI 在環境中造成的非預期變動,從而降低其對人類干預的抵抗動機。
- 涉及對抗性訓練(Adversarial Training)的變體,專門針對 AI 系統在被要求修正時可能產生的『策略性不服從』進行壓力測試。
前景展望基於引用來源的 AI 分析
AI 可修正性研究將成為未來兩年 AI 安全領域的關鍵技術指標。
隨著大模型自主性增強,解決 AI 抵抗人類干預的技術將成為評估模型安全性的核心標準。
此基金將推動更多開源 AI 安全工具的開發。
由於該基金由 Lightcone 託管,獲資助的研究成果預計將以開源形式發布,以促進社群協作。
時間線
2023-05
Lightcone Infrastructure 開始擴大對 AI 對齊社群的基礎設施支援。
2024-11
Lightcone 舉辦首屆針對 AI 安全研究員的技術交流峰會。
2026-07
正式啟動 20 萬美元 AI 可修正性研究基金。
- 2023-05Lightcone Infrastructure 開始擴大對 AI 對齊社群的基礎設施支援。
- 2024-11Lightcone 舉辦首屆針對 AI 安全研究員的技術交流峰會。
- 2026-07正式啟動 20 萬美元 AI 可修正性研究基金。
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AI Alignment Forum ↗
每週電子報
每週一封,可隨時退訂。