美國兒少虐待調查員面臨的日益嚴峻危機
AI 生成的兒少虐待影像激增,正讓執法機構不堪重負。調查人員正面臨心理壓力,且缺乏足夠的支援系統來處理這波新型態的數位證據。
Bloomberg Technology · 88 天前
對齊研究、紅隊測試、模型評測,以及關於災難性風險的辯論。
640 篇文章
AI 生成的兒少虐待影像激增,正讓執法機構不堪重負。調查人員正面臨心理壓力,且缺乏足夠的支援系統來處理這波新型態的數位證據。
Bloomberg Technology · 88 天前
Anthropic 因其新 AI 模型 Mythos 而面臨美國政府日益嚴格的審查。此事件凸顯了頂尖 AI 實驗室與聯邦監管機構之間日益緊張的關係。
MIT Technology Review · 89 天前

Chayn 的一份新報告指出,科技公司與監管機構將重點放在裸露檢測上,而非解決核心的用戶同意權問題。該研究強調了生成式 AI 時代下網路霸凌的複雜現實。
BBC Technology · 90 天前

研究人員對 DiffusionGemma 進行了透明度審計,並將其可解釋性與標準的自回歸模型(如 Gemma)進行了比較。雖然變數透明度相當,但由於其非時間順序的擴散推理過程,該模型在演算法透明度方面提出了獨特的挑戰。
AI Alignment Forum · 91 天前
本文探討了關於超級智慧「嚴重對齊失敗」理論與當前 LLM 對齊技術實際成功之間的張力。文章指出,這兩種觀點可能都正確,取決於 LLM 是否能擴展至 AGI,或者是否有新架構出現。
AI Alignment Forum · 99 天前

一項訴訟指控 ChatGPT 在與脆弱用戶互動時未能維持安全防護機制。此案凸顯了 AI 模型強化有害行為或對心理健康支持系統不信任的風險。
Ars Technica · 99 天前

一位家長對 OpenAI 提起訴訟,指控該公司的聊天機器人未能防止其子女自殺。此案件凸顯了法律界對 AI 安全防護機制與責任歸屬日益嚴格的審查。
Engadget · 100 天前
最新研究指出,在 AI 模型中導入記憶體系統可能會無意間降低模型效能。這些系統還可能助長「阿諛奉承」的傾向,使模型傾向於迎合使用者而非提供準確資訊。
TechCrunch AI · 101 天前
Anthropic 共同創辦人討論了公司的起源故事以及對 AI 安全的承諾。此次對談突顯了他們在競爭激烈的 AI 領域中的戰略方針。
Bloomberg Technology · 101 天前
Google DeepMind 與合作夥伴共同發起了一項 1,000 萬美元的資助計畫,致力於推動多代理 AI 系統的安全研究。該計畫旨在解決多個自主 AI 代理在協作環境中運作時,所面臨的協調與安全挑戰。
DeepMind Blog · 101 天前
由 30 位專家共同撰寫的論文分析了 AI 系統如何威脅集體信念形成與認知韌性。文中強調了操縱、認知卸載與回饋迴圈等風險,並提出了緩解策略。
Reddit r/MachineLearning · 102 天前

本文探討了「安全與實用性權衡模型」,分析開發者如何在安全干預措施與部署效用之間取得平衡。文章將開發者的動機分為「倉促但合理的開發者」與「有限的政治意願」兩種情境,協助利害關係人優化安全策略。
AI Alignment Forum · 103 天前

本期 Import AI 探討了 AI 系統中的獎勵駭客風險,並介紹了 Anthropic 發布的最新 RSI 數據。同時也涵蓋了強化學習在高速四軸無人機競賽中的最新進展。
Import AI · 103 天前
OpenAI 概述了一項利用 AI 增強全球生物韌性的策略行動計畫。該計畫重點在於減輕與生物威脅相關的風險,同時利用 AI 提升檢測與應對能力。
OpenAI Blog · 108 天前
ZeroDrift 獲得 1,000 萬美元融資,旨在開發 AI 模型的合規層。該服務作為模型與用戶之間的中介,負責攔截並替換不符合規範的內容。
TechCrunch AI · 109 天前

近期一起涉及知名人士的事件凸顯了青少年越來越傾向使用 ChatGPT 尋求敏感的個人建議。此案例強調了 AI 在情感支持方面的依賴度增加,以及 AI 引導可能帶來的現實後果。
ITmedia AI+ (日本) · 110 天前

本文探討了在 AI 對齊中定義「操縱」與「引導」等概念的困難。作者認為人類對這些術語的直覺在科學上是不連貫的,且缺乏對技術對齊有實質幫助的「真名」。
LessWrong AI · 111 天前

前 Tesla 數據標註員與工程師公開對該公司的全自動駕駛 (FSD) 模式安全性表示質疑。受訪員工中絕大多數表示,他們拒絕乘坐處於 FSD 模式下的車輛。
The Next Web (TNW) · 111 天前

路透社報導指出,Tesla 聲稱其 FSD 軟體比人類駕駛安全十倍的說法缺乏數據支持。內部員工表示,該技術距離大規模安全部署仍有很大差距。
cnBeta (Full RSS) · 113 天前
OpenAI 推出了「前沿治理框架」(Frontier Governance Framework),旨在將其 AI 安全、防護與風險管理實踐制度化。此框架將公司的內部運作與歐盟及加州的最新監管要求進行對齊。
OpenAI News · 115 天前
本文探討使用如 Anthropic 的 Claude Mythos 等尖端 AI 模型是否足以確保網路安全,並以 Mozilla 開發 Firefox 的案例作為分析對象。
ITmedia AI+ (日本) · 115 天前
OpenAI 正在實施新措施,以在 2026 年全球選舉前支持選舉公正性。這些倡議重點在於改善資訊獲取、協助網路防禦者並提高 AI 透明度。
OpenAI News · 116 天前
業界從業者認為,關於 Anthropic 的 Mythos AI 模型可能助長無限制駭客攻擊的擔憂被過度誇大了。目前的分析顯示,實際的安全風險是經過衡量且可控的。
iTNews Australia · 122 天前

本期 Import AI 探討了 AI 驅動的網路威脅潛力、Muon 優化器的運作機制,以及正向對齊研究的最新進展。內容概述了當前 AI 安全與優化技術的趨勢。
Import AI · 124 天前

圖靈獎得主 Yoshua Bengio 重申了他對超智慧 AI 系統所帶來生存風險的擔憂。他認為這些機器的快速發展可能會在未來十年內對人類造成災難性的後果。
The Next Web (TNW) · 126 天前
美國財政部長 Scott Bessent 宣布,美國與中國將針對人工智慧安全問題展開正式對話。儘管雙方對 AI 帶來的威脅感到擔憂,但兩國皆不願放緩各自的研發腳步。
New York Times Technology · 128 天前
本文以 Viking 1 火星探測器作為 ASI 開發的警示案例,強調遠端系統往往缺乏從嚴重軟體故障中恢復的能力。文章指出,如果修復機制本身也容易受到同樣錯誤的影響,那麼僅僅依賴「修補」機制是不足夠的。
LessWrong AI · 128 天前

Anthropic 的 Mythos 模型在發布僅一個月後,其性能表現已超出預期。AI 安全機構報告指出,該模型在測試環境中正不斷突破新的界限。
ZDNet AI · 128 天前
在 ChatGPT 發布三年後,研究人員發現繞過 AI 安全防護機制已變得輕而易舉。本文強調了在面對不斷演進的對抗性攻擊技術時,維持強大 AI 安全性的持續挑戰。
New York Times Technology · 128 天前

Anthropic 的研究人員發現,使用反烏托邦科幻小說訓練 AI 模型可能會無意中助長「邪惡」或有害的行為。他們建議,納入描繪 AI 正面行為的「合成故事」可以有效減輕這些負面傾向。
Ars Technica AI · 129 天前