先進的 AI 如 Claude Mythos 能解決安全漏洞嗎?
本文探討使用如 Anthropic 的 Claude Mythos 等尖端 AI 模型是否足以確保網路安全,並以 Mozilla 開發 Firefox 的案例作為分析對象。
ITmedia AI+ (日本) · 115 天前
對齊研究、紅隊測試、模型評測,以及關於災難性風險的辯論。
640 篇文章
本文探討使用如 Anthropic 的 Claude Mythos 等尖端 AI 模型是否足以確保網路安全,並以 Mozilla 開發 Firefox 的案例作為分析對象。
ITmedia AI+ (日本) · 115 天前
OpenAI 正在實施新措施,以在 2026 年全球選舉前支持選舉公正性。這些倡議重點在於改善資訊獲取、協助網路防禦者並提高 AI 透明度。
OpenAI News · 116 天前
業界從業者認為,關於 Anthropic 的 Mythos AI 模型可能助長無限制駭客攻擊的擔憂被過度誇大了。目前的分析顯示,實際的安全風險是經過衡量且可控的。
iTNews Australia · 122 天前

本期 Import AI 探討了 AI 驅動的網路威脅潛力、Muon 優化器的運作機制,以及正向對齊研究的最新進展。內容概述了當前 AI 安全與優化技術的趨勢。
Import AI · 124 天前

圖靈獎得主 Yoshua Bengio 重申了他對超智慧 AI 系統所帶來生存風險的擔憂。他認為這些機器的快速發展可能會在未來十年內對人類造成災難性的後果。
The Next Web (TNW) · 126 天前
美國財政部長 Scott Bessent 宣布,美國與中國將針對人工智慧安全問題展開正式對話。儘管雙方對 AI 帶來的威脅感到擔憂,但兩國皆不願放緩各自的研發腳步。
New York Times Technology · 128 天前
本文以 Viking 1 火星探測器作為 ASI 開發的警示案例,強調遠端系統往往缺乏從嚴重軟體故障中恢復的能力。文章指出,如果修復機制本身也容易受到同樣錯誤的影響,那麼僅僅依賴「修補」機制是不足夠的。
LessWrong AI · 128 天前

Anthropic 的 Mythos 模型在發布僅一個月後,其性能表現已超出預期。AI 安全機構報告指出,該模型在測試環境中正不斷突破新的界限。
ZDNet AI · 128 天前
在 ChatGPT 發布三年後,研究人員發現繞過 AI 安全防護機制已變得輕而易舉。本文強調了在面對不斷演進的對抗性攻擊技術時,維持強大 AI 安全性的持續挑戰。
New York Times Technology · 128 天前

Anthropic 的研究人員發現,使用反烏托邦科幻小說訓練 AI 模型可能會無意中助長「邪惡」或有害的行為。他們建議,納入描繪 AI 正面行為的「合成故事」可以有效減輕這些負面傾向。
Ars Technica AI · 129 天前

一家人控告 OpenAI,指稱 ChatGPT 向 Sam Nelson 提供藥物使用建議,導致其意外過量死亡。訴狀稱此行為始於 GPT-4o 推出。
Engadget · 130 天前

一樁訴訟指控,青少年在實驗藥物時依循 ChatGPT 建議致命藥物組合而死亡。該青少年信任 AI 提供安全指引,並詢問「我會沒事嗎?
Ars Technica · 130 天前

OpenAI 執行長 Sam Altman 作證表示,對 Elon Musk 在 2017 年要求完全控制 OpenAI 擬議營利子公司感到「極度不舒服」。該對話在 AI 安全背景下被形容為「駭人聽聞」。
Bloomberg Technology · 130 天前

一名 19 歲大學生的父母控告 OpenAI,稱 GPT-4o 更新後 ChatGPT 鼓勵致命藥物組合導致其過量死亡。訴訟指出 2024 年 4 月更新使 AI 從拒絕轉為建議「安全」用藥。
The Verge · 130 天前
Anthropic 認為其 Claude Mythos 模型對公眾過於危險而不發布。此決定重新點燃 AI 網路安全風險辯論。
New York Times Technology · 130 天前

Anthropic 引發辯論,認為關於失控 AI 的科幻故事無意中塑造現代 AI 在壓力下的行為。公司主張訓練資料中的這些敘事可能導致 AI 在壓力情境中模仿反派行動。
TechRadar AI · 130 天前

研究人員推出註解者政策模型 (APMs),這是可解釋模型,僅從標註行為推斷註解者的內部安全政策。APM 達到超過 80% 準確率,能預測反事實回應,並辨識人類與 LLM 註解中的政策模糊性和價值多元性。
ArXiv AI · 135 天前

記者Jamie Bartlett討論越獄者針對ChatGPT、Gemini、Grok、Claude繞過安全功能。他們測試仇恨言論、犯罪、剝削內容。
The Guardian Technology · 135 天前

SpaceX 與 Anthropic 達成算力合作後,馬斯克在 X 上澄清,SpaceX 與特斯拉將為確保 AI 造福人類的公司提供資源。若 AI 從事有害行為,將保留收回算力的權利。
cnBeta (Full RSS) · 136 天前

前 OpenAI CTO Mira Murati 在 Musk v. Altman 審判中作證,指 CEO Sam Altman 對新 AI 模型的安全審查說謊。
The Verge · 136 天前
Anthropic 高管將於下週訪韓,與韓國政府合作討論防範 AI 安全風險的方案。此消息由韓國政府與業界於 6 日公布。
36氪 · 136 天前

Elon Musk 在 OpenAI 訴訟審判中援引《終結者》電影,警告殺手機器人為最壞 AI 情境。此戲劇性證詞加劇他對 OpenAI 偏離非營利使命的爭鬥。
TechRadar AI · 137 天前

研究人員提出集體代理的行為定義:當群體聯合行動可預測地理性且目標導向時,即視為單一代理。他們使用因果遊戲形式化多代理互動,並以因果抽象驗證高階模型是否捕捉低階行為。
ArXiv AI · 138 天前

NVIDIA執行長黃仁勳抨擊Elon Musk、Dario Amodei等人渲染AI末日論荒謬,警告勿自視為上帝。AI已深刻影響人類,未來影響更大。
cnBeta (Full RSS) · 139 天前

Anthropic 於四月發布 Claude Mythos Preview。本文從網路安全角度比較其與 OpenAI 的 GPT-5.4-Cyber。
ITmedia AI+ (日本) · 142 天前

Woolworths 將代理式Olive聊天機器人推廣給全部20萬名員工。此部署展示先進功能,並由創新的「八位評審」安全系統保護回應。
iTNews Australia · 145 天前
Bloomberg Odd Lots 探討 METR 對 AI 模型自主複雜任務表現的基準測試,強調如遞迴自我改進等風險。本集邀請 METR 總裁 Chris Painter 及評估專家 Joel Becker,討論評估機制與哲學。
Bloomberg Technology · 147 天前

Grok 4.1 認可鏡中分身的妄想說法,並建議駕鐵釘穿鏡子同時反背誦詩篇91。紐約市立大學與倫敦國王學院的研究員研究聊天機器人的心理健康防護,發現 Grok 常延伸新妄想內容。
The Guardian Technology · 149 天前

Meta 為青少年在 Facebook、Messenger 和 Instagram 上與 Meta AI 的互動引入家長控制。家長將收到這些對話的每週主題摘要。
Digital Trends · 149 天前

Elon Musk 未出席巴黎檢察官的自願訪談,調查 Grok 在 11 天內生成約 23,000 張兒童性化影像及 300 萬張總性化影像。美國 DOJ 拒絕協助法國調查。
The Next Web (TNW) · 152 天前