
ARC 重返機制性對齊研究
作者已回到 Alignment Research Center 擔任執行董事,未來六個月將優先推動神經網路行為的機制性解釋,以及運用這些解釋偵測並處理 AI 不對齊問題。ARC 預計快速擴張,目前正在招聘研究員、幕僚長與自動化主管。
Tag: #model-safety45 results

作者已回到 Alignment Research Center 擔任執行董事,未來六個月將優先推動神經網路行為的機制性解釋,以及運用這些解釋偵測並處理 AI 不對齊問題。ARC 預計快速擴張,目前正在招聘研究員、幕僚長與自動化主管。

一項最新調查發現,主流 AI 聊天機器人都能生成逼真的假新聞文章。測試顯示,ChatGPT 可能是最容易被操縱的系統。

這篇深度分析探討開源大型語言模型的快速發展,是否可能帶來具顛覆性、甚至具有破壞性的後果。現有摘錄主要反思開放式 AI 發展所帶來的智慧與風險,未提及特定模型或產品發布。

DeepSeek 針對用戶反饋輸入特殊字符導致異常回覆的問題進行說明。官方澄清此現象為模型幻覺,不涉及任何安全漏洞或隱私洩露。

文章探討 AI 越獄為何引發矽谷憂慮,重點在於人類對失去先進 AI 系統控制權的恐懼。文章將 AI 失控視為重要的社會與技術風險,但未提供太多具體技術細節。