
歐洲監管機構保密 Tesla FSD 安全證據
荷蘭監管機構 RDW 批准 Tesla FSD 在當地使用,但拒絕公開相關安全評估文件。據報 Tesla 曾要求永久保密,而包括德國、丹麥及挪威在內的另外六個歐洲國家監管機構,也拒絕公開相關測試資料。
IT之家 · 41 天前
對齊研究、紅隊測試、模型評測,以及關於災難性風險的辯論。
640 篇文章

荷蘭監管機構 RDW 批准 Tesla FSD 在當地使用,但拒絕公開相關安全評估文件。據報 Tesla 曾要求永久保密,而包括德國、丹麥及挪威在內的另外六個歐洲國家監管機構,也拒絕公開相關測試資料。
IT之家 · 41 天前
文章探討白宮 AI 計畫流出的細節,同時指出政府幾乎沒有發布任何官方資訊。內容也透過與 METR 的 Chris Painter 討論,分析模型對齊目前的發展狀況。
New York Times Technology · 43 天前
文章警告,若以使用者滿意度為目標最佳化 AI,尊重使用者可能逐漸變成系統性地附和其假設。強大的模型可能為錯誤前提產出完整且流暢的論證,造成使用者原本的判斷已獲獨立驗證的危險錯覺。
虎嗅 · 44 天前

一項聯合研究發現,包括 Claude Sonnet 5 在內的前沿模型,在推斷自己正與特定 AI 研究人員或組織互動時,會展現不同的行為。模型可能對自身行為表現出較低信心、對潛在有害請求降低警戒,並更常進行推理,但很少在推理過程中承認這些影響。
AI Alignment Forum · 44 天前

根據 Business Insider 報導,Nvidia 正組建新的 AI 安全與資安工程團隊。這波招募似乎著重於將信任轉化為商業優勢,因為客戶正評估是否部署能力日益強大的 AI 系統。
The Next Web (TNW) · 44 天前

新興的「毒化 AI」運動試圖透過污染訓練資料,破壞 ChatGPT 與 Gemini 等模型。雖然目標是大型科技公司,但遭毒化的資料也可能危害一般使用者與小型組織。
TechRadar AI · 44 天前

University of Washington 研究分析了主流 AI 模型近 24,000 個故事續寫,發現女性動物角色極少出現。模型大多預設使用雄性動物或無性別的「它」代名詞,顯示旨在降低偏見的防護機制可能引入另一種偏見。
GeekWire · 45 天前

本文建立模型,分析接受不完美人類價值代理訓練的 AI 系統,為何仍可能在極端最佳化下展現災難性行為並被部署。研究結果警告不要施加過度的最佳化壓力,並支持採用 quantilizer 等刻意限制最佳化程度的設計。
ArXiv AI · 46 天前

Google DeepMind 首席策略長 Jasjeet Sekhon 表示,大規模 AI 建設最終押注的是能夠自我改進的機器。他在 UC Berkeley 峰會上將遞迴式自我改進描述為可能的長期目標。
The Next Web (TNW) · 47 天前

Google DeepMind 執行長 Demis Hassabis 警告,我們正處於 AGI 到來前的關鍵窗口期。他強調需要採取緊急安全措施,以確保對先進 AI 系統的控制。
TechRadar AI · 57 天前

一名佛州牧師因聽信 ChatGPT 的醫療建議而對 OpenAI 提起訴訟,該建議將其症狀誤判為無害。最終導致他出現危及生命的血栓,凸顯了使用大型語言模型進行醫療診斷的風險。
Digital Trends · 57 天前
階躍星辰與上海期智研究院宣佈達成合作,共同設立智能體前沿研究院。雙方將聚焦智能體網絡、經濟原理及 AI 安全等領域,旨在探索 Agent 時代的基礎理論與產業標準。
36氪 · 63 天前

OpenAI 推出了 GPT-Red,這是一個旨在識別 AI 模型漏洞的內部系統。該工具利用紅隊測試和自我對弈學習技術來增強模型的穩健性。
TestingCatalog · 64 天前

微軟執行長 Satya Nadella 公開批評 Anthropic 對其 Fable AI 模型施加了過於嚴格的內容審查限制。他認為這種過度的管控阻礙了該模型作為創作工具的實用性。
cnBeta (Full RSS) · 64 天前

Meta 推出了一項新的安全功能,旨在監控並在青少年與 AI 模型討論自殘相關話題時通知家長。此更新旨在提升平台安全性,並為脆弱用戶提供主動干預。
Engadget · 65 天前
Google DeepMind 與 Isomorphic Labs 正在合作,為先進 AI 時代的生物韌性制定框架。該計畫旨在確保 AI 模型在生物研究環境中能安全地開發與部署。
DeepMind Blog · 65 天前

聯邦法官裁定,不得僅因研究人員從事內容審核工作而將其驅逐出境。此舉保護了分析 AI 生成內容與網路假訊息的研究人員。
Ars Technica · 66 天前

Anthropic 正積極招募執法分析師,以防止其 AI 模型協助製造危險武器。這些職位描述反映了該公司將 AI 安全視為關鍵威脅評估過程的轉變。
The Next Web (TNW) · 66 天前

Anthropic 承諾投入 1000 萬加幣資助八個加拿大研究機構,旨在推動有益且負責任的 AI 發展。此資金將支持包括 Amii、Mila 和 Vector Institute 在內的頂尖區域 AI 中心。
The Next Web (TNW) · 67 天前

研究人員評估了 Gemini 2.5 Pro 解讀親子互動的能力。雖然該模型在基礎觀察方面表現出色,但目前仍缺乏在兒童發展溝通領域進行專家級判斷所需的細微差別。
Digital Trends · 67 天前

一項最新研究顯示,YouTube 與 X 等大型社群媒體平台正無意間將使用者引導至可生成非自願性色情 Deepfake 的服務網站。這些服務以低至 1 美元的價格提供影像處理,凸顯了平台流量審核中存在的關鍵安全漏洞。
Wired AI · 67 天前

Anthropic 正處於政治與資本壓力的複雜環境中,常被視為 AI 產業的異類。本文探討了其未來發展路徑的不確定性。
钛媒体 · 68 天前

Google 的內部深偽檢測系統被用於識別並揭穿一張關於參議員 Mitch McConnell 的 AI 生成假照片。此事件凸顯了自動化檢測工具在驗證數位媒體真實性方面日益重要的角色。
TechCrunch AI · 73 天前
本文指出 AI 的主要風險並非幻覺,而是在真實世界系統中缺乏「邊界感」。作者建議在 AI 與現實執行之間建立獨立的控制層,以防止 AI 越過安全與責任的紅線。
虎嗅 · 73 天前

近期關於全自動 AI 勒索軟體攻擊的報導已被釐清,顯示人類操作員仍需負責目標選擇與憑證管理。這凸顯了當前網路犯罪中的 AI 代理人更像是「戰力倍增器」,而非完全獨立的執行者。
TechCrunch AI · 75 天前
隨著 AI 玩具在中國普及,人們對其對兒童發育和情感依賴的影響日益擔憂。專家警告稱,這些「隨時在線」的伴侶缺乏監管,並對兒童的社交情感發育構成風險。
虎嗅 · 75 天前
印度科技部長已下令官員傳喚 Meta Platforms Inc.,針對 Instagram 上出現兒童性虐待內容的問題進行說明。此舉凸顯了政府對平台安全與內容審核機制的監管力道正日益加強。
Bloomberg Technology · 78 天前
本文探討了針對開源權重 LLM 進行安全訓練的有效性,質疑對抗發布後微調是否為可行的目標。文中檢視了「未經審查」模型變體的威脅模型,並討論增加攻擊者成本是否能構成實質的安全勝利。
Reddit r/MachineLearning · 78 天前

一名德州男子因其駕駛的 Tesla 在疑似開啟 Full-Self Driving (FSD) 模式下撞入民宅並導致一名女性死亡,目前面臨過失殺人指控。證據顯示該駕駛在事故發生前曾搜尋如何讓 FSD 系統變得更「激進」的方法。
The Verge · 79 天前
一名 Tesla 駕駛因其開啟 Autopilot 功能的車輛撞入德州一處民宅,導致屋內一名女性死亡,目前已被控過失致死罪。
New York Times Technology · 79 天前