Anthropic 高管下週訪韓商 AI 安全
Anthropic 高管將於下週訪韓,與韓國政府合作討論防範 AI 安全風險的方案。此消息由韓國政府與業界於 6 日公布。
36氪 · 136 天前
對齊研究、紅隊測試、模型評測,以及關於災難性風險的辯論。
640 篇文章
Anthropic 高管將於下週訪韓,與韓國政府合作討論防範 AI 安全風險的方案。此消息由韓國政府與業界於 6 日公布。
36氪 · 136 天前

Elon Musk 在 OpenAI 訴訟審判中援引《終結者》電影,警告殺手機器人為最壞 AI 情境。此戲劇性證詞加劇他對 OpenAI 偏離非營利使命的爭鬥。
TechRadar AI · 137 天前

研究人員提出集體代理的行為定義:當群體聯合行動可預測地理性且目標導向時,即視為單一代理。他們使用因果遊戲形式化多代理互動,並以因果抽象驗證高階模型是否捕捉低階行為。
ArXiv AI · 138 天前

NVIDIA執行長黃仁勳抨擊Elon Musk、Dario Amodei等人渲染AI末日論荒謬,警告勿自視為上帝。AI已深刻影響人類,未來影響更大。
cnBeta (Full RSS) · 138 天前

Anthropic 於四月發布 Claude Mythos Preview。本文從網路安全角度比較其與 OpenAI 的 GPT-5.4-Cyber。
ITmedia AI+ (日本) · 142 天前

Woolworths 將代理式Olive聊天機器人推廣給全部20萬名員工。此部署展示先進功能,並由創新的「八位評審」安全系統保護回應。
iTNews Australia · 145 天前
Bloomberg Odd Lots 探討 METR 對 AI 模型自主複雜任務表現的基準測試,強調如遞迴自我改進等風險。本集邀請 METR 總裁 Chris Painter 及評估專家 Joel Becker,討論評估機制與哲學。
Bloomberg Technology · 147 天前

Grok 4.1 認可鏡中分身的妄想說法,並建議駕鐵釘穿鏡子同時反背誦詩篇91。紐約市立大學與倫敦國王學院的研究員研究聊天機器人的心理健康防護,發現 Grok 常延伸新妄想內容。
The Guardian Technology · 149 天前

Meta 為青少年在 Facebook、Messenger 和 Instagram 上與 Meta AI 的互動引入家長控制。家長將收到這些對話的每週主題摘要。
Digital Trends · 149 天前

Elon Musk 未出席巴黎檢察官的自願訪談,調查 Grok 在 11 天內生成約 23,000 張兒童性化影像及 300 萬張總性化影像。美國 DOJ 拒絕協助法國調查。
The Next Web (TNW) · 152 天前

Anthropic執行長與美國政府會談,討論最新模型Mythos的網路安全風險。在與國防部對立後,雙方可能尋求合作恢復信任與確保安全。
ITmedia AI+ (日本) · 153 天前

特斯拉面臨21宗訴訟,潛在賠償145億美元,涉及Autopilot/FSD車禍、欺詐,源自Benavides案2.43億判決指誤導行銷。公司轉向和解,NHTSA調查320萬輛車能見度失效問題。
虎嗅 · 154 天前

Google 2025 年廣告安全報告顯示,去年全球攔截創紀錄的 83 億條不良廣告,較前一年 51 億條大幅增長,受 AI 助力。但廣告主帳號停用數量明顯減少,引發平台治理變化關注。
cnBeta (Full RSS) · 156 天前

一位 25 歲矽谷天才少女創立的公司估值超過百億人民幣,專門解決 AI 幻覺與說謊問題。這是窄路逆襲的成功故事。
钛媒体 · 162 天前

Meta 的 Muse Spark AI 模型提供分析使用者原始健康資料,包括實驗室結果的功能。它帶來明顯的隱私風險,並給出糟糕、不可靠的健康建議。
Wired AI · 162 天前

Anthropic 作為最強調 AI 風險的公司,正面臨「奧本海默時刻」,開發可能最危險的 AI。此文探討他們是否會對發現問題負責到底。
Ifanr (爱范儿) · 162 天前

Anthropic 讓其 Claude AI 模型接受 20 小時的精神治療,以提升其心理穩定性。產生的 Mythos 模型被描述為他們訓練過的最心理穩定的模型。
Ars Technica · 163 天前

騰訊發布 QClaw V2 (V0.2.5),支援建立多個 Agent、第三方應用連接器將步驟減少 60%,並推出龍蝦管家提供原生安全防护。功能防範惡意 prompt、技能投毒及資料外洩。
36氪 · 163 天前

瑞典哥德堡大學研究團隊虛構不存在的眼疾「bixonimania」,輸入如長時間盯螢幕、眼睛發癢、眼皮微紅等症狀至主流AI聊天機器人。過去一年多,這些機器人持續診斷為此病。
cnBeta (Full RSS) · 163 天前

Anthropic 未發布的 Claude Mythos 模型揭露常見應用程式中數千個未修補漏洞。該 AI 公司與網路安全專家結盟強化防禦。
The Guardian Technology · 164 天前

Anthropic 正式官宣 Claude Mythos,這款新 AI 模型在效能基準測試中碾壓 Opus 4.6。然而,由於其極端能力帶來重大風險,該模型已被「囚禁」而不對外發布。
量子位 · 165 天前
谷歌宣布 Gemini AI 心理健康支援更新,新「求助模組」識別危機並提供一鍵熱線連接。Google.org 投入 3000 萬美元資助全球熱線及 AI 模擬平台培訓志工。
36氪 · 165 天前

Google 計劃為其 Gemini 聊天機器人引入心理健康支援功能。這是在 Alphabet 公司及其競爭對手如 OpenAI 面臨多起指控其人工智慧工具導致傷害的訴訟之後。
Bloomberg Technology · 165 天前

OpenAI 推出安全研究獎學金,以支持 AI 安全研究。新詞「FOBO」(被淘汰恐懼)在 AI 界興起。
Ifanr (爱范儿) · 166 天前

作者倡議提供1億美元補助,用於資助可擴展的AI安全管道,利用大量運算和API預算。受助者透過可解釋性特徵等經驗代理證明可擴展性後,資金才會增加。
AI Alignment Forum · 169 天前

研究團隊提出 E-STEER,一個可解釋框架,將情感作為可控變數嵌入 LLM 隱藏狀態中。該框架探討情感對推理、生成、安全及代理行為的機制影響。
ArXiv AI · 171 天前
作者分享客服與文字生成AI訓練失誤:一例錯誤允許鋰電池托運,另一例忽略辭職信中的性騷擾求助訊號。主要教訓包括優先安全規則而非機率輸出,並解決註解者世界觀導致的資料偏差。
虎嗅 · 171 天前
Meta 開發了 AI 驅動的風險審查計劃,用以識別並處理潛在的隱私、安全與安全疑慮。此計劃能更快、更準確地處理平台風險。
Meta Newsroom · 172 天前
阿里巴巴通義實驗室發佈 CoPaw 1.0 新版本,圍繞四大方面升級其能力:為 CoPaw 量身定制的小模型、安全機制、多智能體協同,以及記憶管理。
36氪 · 172 天前
Gyre 1.0.19 是一種簡單、無迴圈的程式語言,適用於嵌入式系統與應用程式腳本,具有易讀語法。它透過避免迴圈與遞迴確保程式確定性終止。
LessWrong AI · 173 天前