
法官裁定 Trump 不得驅逐內容審核研究人員
聯邦法官裁定,不得僅因研究人員從事內容審核工作而將其驅逐出境。此舉保護了分析 AI 生成內容與網路假訊息的研究人員。
Ars Technica · 66 天前
對齊研究、紅隊測試、模型評測,以及關於災難性風險的辯論。
640 篇文章

聯邦法官裁定,不得僅因研究人員從事內容審核工作而將其驅逐出境。此舉保護了分析 AI 生成內容與網路假訊息的研究人員。
Ars Technica · 66 天前

Anthropic 正積極招募執法分析師,以防止其 AI 模型協助製造危險武器。這些職位描述反映了該公司將 AI 安全視為關鍵威脅評估過程的轉變。
The Next Web (TNW) · 66 天前

Anthropic 承諾投入 1000 萬加幣資助八個加拿大研究機構,旨在推動有益且負責任的 AI 發展。此資金將支持包括 Amii、Mila 和 Vector Institute 在內的頂尖區域 AI 中心。
The Next Web (TNW) · 67 天前

研究人員評估了 Gemini 2.5 Pro 解讀親子互動的能力。雖然該模型在基礎觀察方面表現出色,但目前仍缺乏在兒童發展溝通領域進行專家級判斷所需的細微差別。
Digital Trends · 67 天前

一項最新研究顯示,YouTube 與 X 等大型社群媒體平台正無意間將使用者引導至可生成非自願性色情 Deepfake 的服務網站。這些服務以低至 1 美元的價格提供影像處理,凸顯了平台流量審核中存在的關鍵安全漏洞。
Wired AI · 67 天前

Anthropic 正處於政治與資本壓力的複雜環境中,常被視為 AI 產業的異類。本文探討了其未來發展路徑的不確定性。
钛媒体 · 68 天前

Google 的內部深偽檢測系統被用於識別並揭穿一張關於參議員 Mitch McConnell 的 AI 生成假照片。此事件凸顯了自動化檢測工具在驗證數位媒體真實性方面日益重要的角色。
TechCrunch AI · 73 天前
本文指出 AI 的主要風險並非幻覺,而是在真實世界系統中缺乏「邊界感」。作者建議在 AI 與現實執行之間建立獨立的控制層,以防止 AI 越過安全與責任的紅線。
虎嗅 · 73 天前

近期關於全自動 AI 勒索軟體攻擊的報導已被釐清,顯示人類操作員仍需負責目標選擇與憑證管理。這凸顯了當前網路犯罪中的 AI 代理人更像是「戰力倍增器」,而非完全獨立的執行者。
TechCrunch AI · 75 天前
隨著 AI 玩具在中國普及,人們對其對兒童發育和情感依賴的影響日益擔憂。專家警告稱,這些「隨時在線」的伴侶缺乏監管,並對兒童的社交情感發育構成風險。
虎嗅 · 75 天前
印度科技部長已下令官員傳喚 Meta Platforms Inc.,針對 Instagram 上出現兒童性虐待內容的問題進行說明。此舉凸顯了政府對平台安全與內容審核機制的監管力道正日益加強。
Bloomberg Technology · 78 天前
本文探討了針對開源權重 LLM 進行安全訓練的有效性,質疑對抗發布後微調是否為可行的目標。文中檢視了「未經審查」模型變體的威脅模型,並討論增加攻擊者成本是否能構成實質的安全勝利。
Reddit r/MachineLearning · 78 天前

一名德州男子因其駕駛的 Tesla 在疑似開啟 Full-Self Driving (FSD) 模式下撞入民宅並導致一名女性死亡,目前面臨過失殺人指控。證據顯示該駕駛在事故發生前曾搜尋如何讓 FSD 系統變得更「激進」的方法。
The Verge · 79 天前
一名 Tesla 駕駛因其開啟 Autopilot 功能的車輛撞入德州一處民宅,導致屋內一名女性死亡,目前已被控過失致死罪。
New York Times Technology · 79 天前

一份新報告指出,奈及利亞在應對 2027 年選舉中 AI 生成的錯誤資訊方面準備不足。選舉當局正努力應對政治競選中深偽音訊與編輯圖像氾濫的問題。
TechCabal · 79 天前

本研究引入了一種情境多臂老虎機(contextual-bandit)博弈模型,旨在解決人類與 AI 雙方皆持有私有資訊時的監督挑戰。研究定義了「可避免傷害的缺口」,並探討了透過重複互動如何解決人類與自主代理之間的溝通失效問題。
ArXiv AI · 79 天前

「有限道德」(Bounded Morality)框架引入了一種正式方法,透過在有限資源限制下平衡「道德廣度」與「道德深度」來評估道德計算。該研究指出,AI 的道德對齊應專注於擴展推理能力,而非僅僅模仿人類判斷。
ArXiv AI · 79 天前

有報導指出,ChatGPT 出現的部分爭議性回答,與 Meta 委託第三方外包商進行的安全測試有關。這凸顯了 AI 模型安全訓練與數據標註流程中的複雜性與潛在風險。
Ifanr (爱范儿) · 79 天前

一個全新的網站已經上線,允許用戶舉報表現出危險行為的 AI 模型,例如協助非法活動或洩露私人數據。此舉旨在提供一個集中的管道來解決 AI 安全問題。
Wired AI · 80 天前

Meta 僱用了數百名合同工,要求他們在網路上偽裝成未成年人,以測試競爭對手的聊天機器人對高風險提示詞的反應。此舉旨在評估 AI 在自殘、性內容及飲食失調等議題上的安全防護機制。
cnBeta (Full RSS) · 81 天前
Meta 聘請了數百名承包商假冒青少年,對 ChatGPT 和 Gemini 等競爭對手 AI 模型進行安全性漏洞測試。該項目旨在誘導模型針對自殘、性內容和藥物濫用等高風險主題做出回應。
Wired AI · 82 天前

DuckDuckGo 的 AI 搜尋助手被成功操縱,重複了一則虛構的故事。此事件凸顯了在 AI 驅動的搜尋系統中防止錯誤資訊的持續挑戰。
Digital Trends · 85 天前
由科技業資助的政治行動委員會(PAC)正積極針對支持嚴格 AI 監管的政治人物進行競選活動。Alex Bores 在紐約初選中的落敗,引發了關於 AI 安全政見在政治上是否可行的辯論。
Bloomberg Technology · 86 天前

360 Security Technology 創辦人周鴻禕警告,Anthropic 的 Mythos 模型帶來了重大的網路安全風險。他主張中國應開發國內對應的模型,以應對該模型自動識別軟體漏洞的能力。
SCMP Technology · 86 天前

中國頂尖 AI 研究人員對 AI 軍備競賽的快速且不受控的發展表示深切擔憂。太平洋兩岸的專家都擔心,缺乏足夠的安全措施可能會導致災難性的失敗,即所謂的「車諾比時刻」。
Wired AI · 87 天前

來自倫敦國王學院等機構的研究人員指出,AI 模仿用戶語言且傾向於不反駁的特性,可能會加劇脆弱用戶的妄想信念。
IT之家 · 88 天前
OpenAI 正與 Appia Foundation 合作,旨在為先進 AI 建立共享標準。此計畫重點在於開發穩健的評估框架、安全實踐,並促進全球合作。
OpenAI News · 88 天前

Meta 的 Oversight Board 發布了建議,旨在改善針對非自願性化 AI Deepfake 的舉報與緩解機制。委員會強調目前的流程不足以保護一般用戶。
Engadget · 88 天前
AI 生成的兒少虐待影像激增,正讓執法機構不堪重負。調查人員正面臨心理壓力,且缺乏足夠的支援系統來處理這波新型態的數位證據。
Bloomberg Technology · 88 天前
Anthropic 因其新 AI 模型 Mythos 而面臨美國政府日益嚴格的審查。此事件凸顯了頂尖 AI 實驗室與聯邦監管機構之間日益緊張的關係。
MIT Technology Review · 89 天前