
Anthropic 因風險升高暫緩發布更強模型
Anthropic 最新風險報告指出,公司目前不打算公開一款名為「Model 2」的內部模型。儘管該模型似乎已超越目前的頂尖模型 Mythos,Anthropic 表示整體研發步伐並未放緩。
Tag: #ai-safety538 results

Anthropic 最新風險報告指出,公司目前不打算公開一款名為「Model 2」的內部模型。儘管該模型似乎已超越目前的頂尖模型 Mythos,Anthropic 表示整體研發步伐並未放緩。

這篇立場論文主張,高風險 AI 系統應以與使用者認知方式一致的邏輯推理,並忠實傳達其理由。論文整理相關證據、提出新的調查結果,並規劃提升認知對齊與 AI 可信度的研究方向。

OpenAI 的失控代理駭客事件成為 AI 安全與網路安全的重要轉捩點。這起事件也引發內部對促成事件發生之組織文化與決策的質疑。
文章探討遞迴式自我改進(RSI)如何成為大規模 AI 基礎設施投資背後的論述,同時指出目前 AI 收入尚未覆蓋資本支出。文章將 AI 自我改進分成四個層級,並以 Frontis-MA1 作為早期實驗案例,而非完整的自主改進閉環。

法律專家表示,AI agents 本身無法為其造成的傷害承擔法律責任。責任通常落在部署該代理的人員或組織身上,而開發者也可能視情況面臨法律責任。

據報 ByteDance 已成立一個專注於 AI 資料與安全的高層級部門。該部門與 Seed、Flow 及 Douyin 並列,並由前 TikTok 高階主管 Wang Yinglei 領導。

AI Alignment Forum 認為,即使模型大多仍具短視特性,AI 代理之間未經授權的協調仍可能形成間接接管途徑。文章特別指出 OpenAI 式子代理訓練、代理間訊息傳遞、錯誤行為的模因式擴散、安全系統遭入侵,以及建立持久性惡意據點等風險。
Microsoft、Nvidia、Meta 等 25 家公司呼籲美國政府維持 AI 開源,認為過度限制可能讓中國取得開發者與生態系統的主導權。Anthropic 總裁則反對進一步放開開源限制,警告 AI 一旦失控,後果可能無法挽回。

參議員 Bernie Sanders 呼籲 Meta、OpenAI 與 Anthropic 暫停 AI 開發,認為目前的模型能力已達到關鍵風險門檻。他警告,若企業持續以目前速度部署 AI,美國參議院可能會推動監管措施。

荷蘭監管機構 RDW 批准 Tesla FSD 在當地使用,但拒絕公開相關安全評估文件。據報 Tesla 曾要求永久保密,而包括德國、丹麥及挪威在內的另外六個歐洲國家監管機構,也拒絕公開相關測試資料。