Search

Tag: #model-safety45 results

ARC 重返機制性對齊研究

ARC 重返機制性對齊研究

作者已回到 Alignment Research Center 擔任執行董事,未來六個月將優先推動神經網路行為的機制性解釋,以及運用這些解釋偵測並處理 AI 不對齊問題。ARC 預計快速擴張,目前正在招聘研究員、幕僚長與自動化主管。

AI Alignment ForumCommunityAug 4#ai-alignment#model-safety#reward-hacking
Page 5 of 5