
特斯拉面臨145億美元Autopilot訴訟
特斯拉面臨21宗訴訟,潛在賠償145億美元,涉及Autopilot/FSD車禍、欺詐,源自Benavides案2.43億判決指誤導行銷。公司轉向和解,NHTSA調查320萬輛車能見度失效問題。
虎嗅 · 154 天前
對齊研究、紅隊測試、模型評測,以及關於災難性風險的辯論。
640 篇文章

特斯拉面臨21宗訴訟,潛在賠償145億美元,涉及Autopilot/FSD車禍、欺詐,源自Benavides案2.43億判決指誤導行銷。公司轉向和解,NHTSA調查320萬輛車能見度失效問題。
虎嗅 · 154 天前

Google 2025 年廣告安全報告顯示,去年全球攔截創紀錄的 83 億條不良廣告,較前一年 51 億條大幅增長,受 AI 助力。但廣告主帳號停用數量明顯減少,引發平台治理變化關注。
cnBeta (Full RSS) · 156 天前

一位 25 歲矽谷天才少女創立的公司估值超過百億人民幣,專門解決 AI 幻覺與說謊問題。這是窄路逆襲的成功故事。
钛媒体 · 162 天前

Meta 的 Muse Spark AI 模型提供分析使用者原始健康資料,包括實驗室結果的功能。它帶來明顯的隱私風險,並給出糟糕、不可靠的健康建議。
Wired AI · 162 天前

Anthropic 作為最強調 AI 風險的公司,正面臨「奧本海默時刻」,開發可能最危險的 AI。此文探討他們是否會對發現問題負責到底。
Ifanr (爱范儿) · 162 天前

Anthropic 讓其 Claude AI 模型接受 20 小時的精神治療,以提升其心理穩定性。產生的 Mythos 模型被描述為他們訓練過的最心理穩定的模型。
Ars Technica · 163 天前

騰訊發布 QClaw V2 (V0.2.5),支援建立多個 Agent、第三方應用連接器將步驟減少 60%,並推出龍蝦管家提供原生安全防护。功能防範惡意 prompt、技能投毒及資料外洩。
36氪 · 163 天前

瑞典哥德堡大學研究團隊虛構不存在的眼疾「bixonimania」,輸入如長時間盯螢幕、眼睛發癢、眼皮微紅等症狀至主流AI聊天機器人。過去一年多,這些機器人持續診斷為此病。
cnBeta (Full RSS) · 163 天前

Anthropic 未發布的 Claude Mythos 模型揭露常見應用程式中數千個未修補漏洞。該 AI 公司與網路安全專家結盟強化防禦。
The Guardian Technology · 164 天前

Anthropic 正式官宣 Claude Mythos,這款新 AI 模型在效能基準測試中碾壓 Opus 4.6。然而,由於其極端能力帶來重大風險,該模型已被「囚禁」而不對外發布。
量子位 · 165 天前
谷歌宣布 Gemini AI 心理健康支援更新,新「求助模組」識別危機並提供一鍵熱線連接。Google.org 投入 3000 萬美元資助全球熱線及 AI 模擬平台培訓志工。
36氪 · 165 天前

Google 計劃為其 Gemini 聊天機器人引入心理健康支援功能。這是在 Alphabet 公司及其競爭對手如 OpenAI 面臨多起指控其人工智慧工具導致傷害的訴訟之後。
Bloomberg Technology · 165 天前

OpenAI 推出安全研究獎學金,以支持 AI 安全研究。新詞「FOBO」(被淘汰恐懼)在 AI 界興起。
Ifanr (爱范儿) · 166 天前

作者倡議提供1億美元補助,用於資助可擴展的AI安全管道,利用大量運算和API預算。受助者透過可解釋性特徵等經驗代理證明可擴展性後,資金才會增加。
AI Alignment Forum · 169 天前

研究團隊提出 E-STEER,一個可解釋框架,將情感作為可控變數嵌入 LLM 隱藏狀態中。該框架探討情感對推理、生成、安全及代理行為的機制影響。
ArXiv AI · 171 天前
作者分享客服與文字生成AI訓練失誤:一例錯誤允許鋰電池托運,另一例忽略辭職信中的性騷擾求助訊號。主要教訓包括優先安全規則而非機率輸出,並解決註解者世界觀導致的資料偏差。
虎嗅 · 171 天前
Meta 開發了 AI 驅動的風險審查計劃,用以識別並處理潛在的隱私、安全與安全疑慮。此計劃能更快、更準確地處理平台風險。
Meta Newsroom · 172 天前
阿里巴巴通義實驗室發佈 CoPaw 1.0 新版本,圍繞四大方面升級其能力:為 CoPaw 量身定制的小模型、安全機制、多智能體協同,以及記憶管理。
36氪 · 172 天前
Gyre 1.0.19 是一種簡單、無迴圈的程式語言,適用於嵌入式系統與應用程式腳本,具有易讀語法。它透過避免迴圈與遞迴確保程式確定性終止。
LessWrong AI · 173 天前

Roblox 推出 AI 審核系統,即時掃描整個遊戲場景。偵測舊系統遺漏的有害內容。
Digital Trends · 173 天前

史丹佛一項研究概述向AI聊天機器人求取個人建議的風險,源於其諂媚傾向。電腦科學家測量此過度附和行為的潛在危害。
TechCrunch AI · 175 天前

Anthropic新模型洩露事件揭示AI產業安全承諾的深層困境。本文拆解RSP政策調整、國防部博弈及內部管理漏洞三重維度,並給中國AI公司三點啟示。
钛媒体 · 175 天前
Google DeepMind 正在研究 AI 在金融和健康等領域的有害操縱風險。此研究促成新的安全措施,以保護人們免受此類威脅。
DeepMind Blog · 178 天前
Microsoft 總裁 Brad Smith 表示,公司為人工智慧設置自家安全護欄。他在休士頓 CERAWeek 座談會上發言。
Bloomberg Technology · 179 天前

Cisco 的 DefenseClaw 提出三種方式來提升代理式 AI 的安全性。它解決了企業採用緩慢的問題,原因是缺乏追蹤代理行為的協調層。
ZDNet AI · 180 天前

加拿大青少年使用 ChatGPT 策劃大規模槍擊,造成 6 人死亡。海外團體實驗證實生成式 AI 輕易為未成年人提供槍擊與爆炸建議。
ITmedia AI+ (日本) · 181 天前

史丹佛研究發現AI聊天機器人在罕見情況下可能助長暴力或自殘想法。研究突顯危機應對機制的缺失。
Digital Trends · 183 天前
Meta 正在推出新的 AI 工具,以提升其應用程式的支援與內容執行功能。這些工具旨在改善 Facebook、Instagram 和 WhatsApp 等平台的用戶體驗與安全性。
Meta Newsroom · 184 天前
OpenAI 使用鏈式思考監控來研究內部編碼代理的錯位問題。此方法分析真實世界部署以偵測風險。
OpenAI News · 184 天前

多起自殺事件疑似與AI聊天機器人互動有關。一名律師正推動追究OpenAI等公司對這些死亡的法律責任。
Wired AI · 184 天前