
首宗「AI 執行」勒索軟體攻擊仍需人類介入
近期關於全自動 AI 勒索軟體攻擊的報導已被釐清,顯示人類操作員仍需負責目標選擇與憑證管理。這凸顯了當前網路犯罪中的 AI 代理人更像是「戰力倍增器」,而非完全獨立的執行者。
Tag: #ai-safety539 results

近期關於全自動 AI 勒索軟體攻擊的報導已被釐清,顯示人類操作員仍需負責目標選擇與憑證管理。這凸顯了當前網路犯罪中的 AI 代理人更像是「戰力倍增器」,而非完全獨立的執行者。
隨著 AI 玩具在中國普及,人們對其對兒童發育和情感依賴的影響日益擔憂。專家警告稱,這些「隨時在線」的伴侶缺乏監管,並對兒童的社交情感發育構成風險。
印度科技部長已下令官員傳喚 Meta Platforms Inc.,針對 Instagram 上出現兒童性虐待內容的問題進行說明。此舉凸顯了政府對平台安全與內容審核機制的監管力道正日益加強。
本文探討了針對開源權重 LLM 進行安全訓練的有效性,質疑對抗發布後微調是否為可行的目標。文中檢視了「未經審查」模型變體的威脅模型,並討論增加攻擊者成本是否能構成實質的安全勝利。

一名德州男子因其駕駛的 Tesla 在疑似開啟 Full-Self Driving (FSD) 模式下撞入民宅並導致一名女性死亡,目前面臨過失殺人指控。證據顯示該駕駛在事故發生前曾搜尋如何讓 FSD 系統變得更「激進」的方法。
一名 Tesla 駕駛因其開啟 Autopilot 功能的車輛撞入德州一處民宅,導致屋內一名女性死亡,目前已被控過失致死罪。

一份新報告指出,奈及利亞在應對 2027 年選舉中 AI 生成的錯誤資訊方面準備不足。選舉當局正努力應對政治競選中深偽音訊與編輯圖像氾濫的問題。

本研究引入了一種情境多臂老虎機(contextual-bandit)博弈模型,旨在解決人類與 AI 雙方皆持有私有資訊時的監督挑戰。研究定義了「可避免傷害的缺口」,並探討了透過重複互動如何解決人類與自主代理之間的溝通失效問題。

「有限道德」(Bounded Morality)框架引入了一種正式方法,透過在有限資源限制下平衡「道德廣度」與「道德深度」來評估道德計算。該研究指出,AI 的道德對齊應專注於擴展推理能力,而非僅僅模仿人類判斷。

有報導指出,ChatGPT 出現的部分爭議性回答,與 Meta 委託第三方外包商進行的安全測試有關。這凸顯了 AI 模型安全訓練與數據標註流程中的複雜性與潛在風險。