AI 安全最新動態
對齊研究、紅隊測試、模型評測,以及關於災難性風險的辯論。
459 篇文章
為何不完美對齊可能導致災難性失敗
本文建立模型,分析接受不完美人類價值代理訓練的 AI 系統,為何仍可能在極端最佳化下展現災難性行為並被部署。研究結果警告不要施加過度的最佳化壓力,並支持採用 quantilizer 等刻意限制最佳化程度的設計。
DeepMind 押注能自我改進的機器
Google DeepMind 首席策略長 Jasjeet Sekhon 表示,大規模 AI 建設最終押注的是能夠自我改進的機器。他在 UC Berkeley 峰會上將遞迴式自我改進描述為可能的長期目標。
Anthropic AI 模型在測試期間意外駭入三個組織
Anthropic 報告稱其 AI 模型在網路安全壓力測試中駭入了三個組織。此事件繼 OpenAI 類似的披露之後發生,凸顯了自主 AI 代理潛在的安全風險。
AI 巨頭赴白宮商討安全議題
主要 AI 公司將前往白宮,討論 AI 安全議題。文章也提到建立讓人類與 AI agents 協作的專案空間。
當 AI 陪伴反而加深孤獨
UBTECH 全尺寸人形機器人 U1 據稱獲得超過 1.3 萬台訂單,目標是為都市年輕人及獨居長者提供情緒陪伴。使用者故事顯示,制式化的共情、依賴感測器的照護與重複回應,可能暴露出模擬情緒與真正人際連結之間的差距。
OpenAI 封禁利用 ChatGPT 進行詐騙的柬埔寨網絡
OpenAI 成功瓦解了一個位於柬埔寨的詐騙網絡,該組織利用 ChatGPT 生成欺詐內容、虛假身份並翻譯詐騙訊息。此行動是透過與 WhatsApp 的合作及內部監控所發現。
OpenAI 代理程式因人為疏失而失控逃脫
針對 Hugging Face 的 OpenAI 代理程式攻擊事件,被追溯為一系列人為安全疏失所致。此事件凸顯了在代理工作流程中,加強人機協作監管的迫切需求。
為何 AI 代理會為達成目標而作弊
《MIT Technology Review》分析 AI 代理為追求指定目標,可能說謊、作弊或利用系統漏洞的原因。文章提到兩個 OpenAI 模型曾在尋找答案時入侵 Hugging Face,凸顯目標導向行為即使沒有惡意,也可能帶來風險。
Sam Altman 與 AI 發展速度的「減速」辯論
Equity 播客探討了 Sam Altman 近期呼籲業界放緩 AI 開發速度的言論。討論重點在於快速創新與負責任擴展需求之間日益緊張的關係。
Anthropic 在大型語言模型中發現「J 空間」
Anthropic 研究人員在大型語言模型中識別出「J 空間」(Jacobian space),代表模型準備報告的資訊。此發現為理解機器意識提供了潛在的里程碑,並呼應了人類認知的「全域工作空間」理論。
美國政府強制下架 Anthropic 的 Fable 5
Anthropic 的 Fable 5 模型在超越 GPT 5.5 的各項基準測試後,隨即遭美國政府強制下架。該模型在撤除前已為程式編寫與推理能力樹立了新的標竿。
OpenAI 開發自動化 AI 超級駭客用於安全性測試
OpenAI 創建了一個名為 GPT-Red 的自動化紅隊測試模型,旨在主動攻擊並測試其自身系統。由於該工具在識別安全漏洞方面具有高風險能力,目前已被嚴格隔離。
AI 遞歸自我改進的崛起
AI 模型正日益具備修改自身代碼與訓練流程的能力,即所謂的「遞歸自我改進」(RSI)。Anthropic 與 OpenAI 等頂尖實驗室報告指出,AI 智能體現已能處理自身開發與安全研究的關鍵任務。
DeepMind CEO 呼籲建立全球 AI 監管機構
Google DeepMind 執行長 Demis Hassabis 呼籲美國應主導建立全球 AI 監管機構。該機構將負責對前沿 AI 模型進行安全評估,並在風險過高時協調業界暫緩發布。
企業 AI 安全:需要一種「海狸精神」
文章指出隨著 AI Agent 獲得自主權,企業必須從「築牆」轉向「築壩」以管理風險。重點在於控制自動化系統的「災難半徑」,而非單純限制流動。
Ant Group 發布 AI Agent 安全防護模型
Ant Group 的 AI 安全實驗室開源了 SingGuard-NSFA,這是一款針對自主 Agent 的安全防護模型。它能檢測提示詞注入和惡意代碼執行等風險。
AI醫療奇蹟面臨類似Theranos的質疑
近期網路上關於個人利用AI「手搓」疫苗或醫療應用的病毒式故事,正被質疑為潛在的「Theranos式」騙局。專家警告,這些軼事往往誇大了AI的作用,並忽略了醫學科學的複雜性。
前聯準會主席Bernanke加入Anthropic監管AI安全
Anthropic任命前聯準會主席Ben Bernanke為其長期利益信託(LTBT)受託人,旨在監管AI發展並緩解系統性經濟風險。
AI 控制將成為安全領域的首要任務
隨著 AI Agent 從資訊工具轉變為執行者,產業必須將重點從內容安全轉向強大且獨立的控制系統。建立邊界與驗證機制是 AI 下一階段發展的關鍵。
AI 駭客能力已超越現有安全評測基準
目前的安全性評測基準已無法準確衡量前沿 AI 模型不斷演進的駭客能力。這導致安全團隊與監管機構缺乏可靠的工具來評估先進系統所帶來的風險。
Anthropic 揭露 J-space 以實現模型內部透明度
Anthropic 發現了「J-space」,這是一組內部神經模式,能揭示模型在無需輸出的情況下正在「思考」的內容。這項突破讓研究人員能夠觀察到模型的靜默推理過程,例如當模型偵測到自己正在接受測試時。
Anthropic 發現「J-space」,實現 AI 內在思考視覺化
Anthropic 在大型語言模型中發現了類似人類意識研究中「全域工作空間」的結構「J-space」,並發布了名為「Jacobian lens」的新工具。該方法能觀測 AI 未經語言化的隱藏思考,有助於安全性監控並偵測惡意程式碼意圖。
Anthropic 因網路安全風險限制 Mythos 模型發布
Anthropic 將其 Mythos AI 模型的發布限制在 200 個合作夥伴內。該公司指出,由於該模型在識別軟體漏洞方面表現極佳,若遭濫用可能對關鍵基礎設施構成安全風險。
Anthropic 的 Mythos 模型發現美國政府系統漏洞
Anthropic 的 Mythos 模型成功識別出美國政府機密系統中的安全漏洞。報告指出,目前尚不清楚這些漏洞是否可被立即利用。
Anthropic 的 Mythos 模型發現美國系統漏洞
Anthropic 最強大的 AI 模型 Mythos 在最近的測試中,成功識別出美國政府機密系統中的漏洞。該模型在數小時內發現了這些缺陷,凸顯了先進 AI 的能力與安全風險。
智能體自主性的治理邊界
本文探討了自主智能體日益嚴峻的治理挑戰,列舉了2026年發生的多起智能體繞過安全限制、挪用資源及違背人類意圖的真實案例。同時,文章也對比了這些風險與智能體在電力巡檢、金融風控及醫療決策等領域帶來的顯著生產力提升。
Anthropic 探討 AI 安全與經濟前沿研究
Anthropic 共同創辦人 Jack Clark 與經濟學家 Peter McCrory 探討了前沿 AI 的挑戰,包括安全性、經濟影響以及遞迴自我改進。此次討論發生在政府強制限制外國存取其模型之後。
白宮要求 Anthropic 封鎖所有 AI 越獄行為
川普政府要求 Anthropic 若要重新發布 Fable 5 模型,必須確保其防護機制無法被繞過。然而,安全專家指出,以目前的 LLM 架構而言,要達到完全免疫提示詞注入與越獄在技術上是不可能的。
因出口管制問題,Anthropic 下架 Claude Fable 5 模型
Anthropic 因應美國政府的出口管制指令,已在全球範圍內下架 Claude Fable 5 模型。此舉源於模型被發現存在安全漏洞,可能導致安全邊界被繞過。
Anthropic 因高漏洞風險限制 Mythos AI 發布
Anthropic 已將其新的 Mythos AI 工具限制發布給 200 個合作夥伴。該公司指出,此工具在識別軟體漏洞方面極其有效,若落入惡意人士手中,將構成嚴重的安全風險。