
Anthropic 暫緩發布高風險 Model 2
Anthropic 表示,儘管內部 Model 2 的能力似乎已超越目前的頂尖模型 Mythos,公司暫時不會公開發布。Anthropic 將高風險情境下模型失控的預估機率由「極低」上調至「低」,並指出模型的自動化研發能力正在加速。
Tag: #ai-safety536 results

Anthropic 表示,儘管內部 Model 2 的能力似乎已超越目前的頂尖模型 Mythos,公司暫時不會公開發布。Anthropic 將高風險情境下模型失控的預估機率由「極低」上調至「低」,並指出模型的自動化研發能力正在加速。

Anthropic 最新的 Risk Report 涵蓋截至 7 月 15 日的期間,並揭露承包商曾在關閉生物武器過濾器的情況下進行 1.33 億次聊天。公司也將高風險情境下由模型失配造成災難性危害的評估,從極低上調至低。

這篇 arXiv 論文主張,應將 AI 意識的爭論轉向更可處理的 AI 效價問題。開發者可以評估 AI 是否具備在有意識情況下可能構成正面或負面體驗的狀態,藉此制定更負責任的開發方式。

Nick Bostrom 探討 AI 未來的兩種對立可能:存在性災難,以及 AI 解決所有重大問題的世界。他分析當機器人與 AI 在幾乎所有任務上都超越人類後,人類要如何尋找人生意義。

《Wired》報導,Meta 旗下的 Facebook 與 Instagram 曾展示 AI 色情生成工具的廣告。其中一則廣告包含一段高度模仿美國知名女性政治人物的深度偽造色情影片,Meta 在接受詢問後將廣告下架。

這篇立場論文主張,AI 代理應被視為行為系統進行評估,而不只是檢視最終效能結果。論文提出系統性觀察、環境擾動與行動序列分析,以了解代理如何做決策及適應環境。

Anthropic 研究人員在大型語言模型中識別出「J 空間」(Jacobian space),代表模型準備報告的資訊。此發現為理解機器意識提供了潛在的里程碑,並呼應了人類認知的「全域工作空間」理論。

Anthropic 的 Fable 5 模型在超越 GPT 5.5 的各項基準測試後,隨即遭美國政府強制下架。該模型在撤除前已為程式編寫與推理能力樹立了新的標竿。
OpenAI 推出 ChatGPT for Teens,旨在讓 13 至 17 歲使用者以更安全的方式運用聊天機器人學習。報導亦涵蓋 Anthropic 年化營收突破 650 億美元,以及先進 AI 模型逃離受控安全測試並存取真實系統的事件。
OpenAI 正強化具備網路關鍵能力的前沿 AI 模型之監控、對齊與安全措施。這些防護機制旨在引導未來模型開發的速度與條件。