
Gemini 2.5 Pro 在兒童溝通分析上顯示出局限性
研究人員評估了 Gemini 2.5 Pro 解讀親子互動的能力。雖然該模型在基礎觀察方面表現出色,但目前仍缺乏在兒童發展溝通領域進行專家級判斷所需的細微差別。
Tag: #ai-safety539 results

研究人員評估了 Gemini 2.5 Pro 解讀親子互動的能力。雖然該模型在基礎觀察方面表現出色,但目前仍缺乏在兒童發展溝通領域進行專家級判斷所需的細微差別。

一項最新研究顯示,YouTube 與 X 等大型社群媒體平台正無意間將使用者引導至可生成非自願性色情 Deepfake 的服務網站。這些服務以低至 1 美元的價格提供影像處理,凸顯了平台流量審核中存在的關鍵安全漏洞。

Anthropic 正處於政治與資本壓力的複雜環境中,常被視為 AI 產業的異類。本文探討了其未來發展路徑的不確定性。

Google 的內部深偽檢測系統被用於識別並揭穿一張關於參議員 Mitch McConnell 的 AI 生成假照片。此事件凸顯了自動化檢測工具在驗證數位媒體真實性方面日益重要的角色。
本文指出 AI 的主要風險並非幻覺,而是在真實世界系統中缺乏「邊界感」。作者建議在 AI 與現實執行之間建立獨立的控制層,以防止 AI 越過安全與責任的紅線。

近期關於全自動 AI 勒索軟體攻擊的報導已被釐清,顯示人類操作員仍需負責目標選擇與憑證管理。這凸顯了當前網路犯罪中的 AI 代理人更像是「戰力倍增器」,而非完全獨立的執行者。
隨著 AI 玩具在中國普及,人們對其對兒童發育和情感依賴的影響日益擔憂。專家警告稱,這些「隨時在線」的伴侶缺乏監管,並對兒童的社交情感發育構成風險。
印度科技部長已下令官員傳喚 Meta Platforms Inc.,針對 Instagram 上出現兒童性虐待內容的問題進行說明。此舉凸顯了政府對平台安全與內容審核機制的監管力道正日益加強。
本文探討了針對開源權重 LLM 進行安全訓練的有效性,質疑對抗發布後微調是否為可行的目標。文中檢視了「未經審查」模型變體的威脅模型,並討論增加攻擊者成本是否能構成實質的安全勝利。

一名德州男子因其駕駛的 Tesla 在疑似開啟 Full-Self Driving (FSD) 模式下撞入民宅並導致一名女性死亡,目前面臨過失殺人指控。證據顯示該駕駛在事故發生前曾搜尋如何讓 FSD 系統變得更「激進」的方法。