內容審核最新動態
規模化的自動信任與安全:分類器、深偽檢測與政策執行。
197 篇文章
Spotify 因用戶成長放緩下調利潤指引
Spotify 預測第三季營業收入為 6.7 億歐元,低於華爾街預估的 6.78 億歐元。公司同時面臨用戶成長放緩,以及串流平台上 AI 生成歌曲激增的問題。
中國清理逾 1.33 萬條 AI 魔改影片
中國國家廣播電視總局公布,7 月清理逾 13,300 條違規 AI 魔改影片,並處置超過 30 個帳號。治理工作聚焦於扭曲經典作品、歷史、文化符號或兒童動畫形象的 AI 生成內容。
Reddit 面臨新一波 AI SEO 垃圾內容攻勢
The Verge 探討 Reddit 是否能遏制新一波由 AI 驅動的 SEO 垃圾內容。一則看似可疑的護膚品推薦留言推廣了 Honeydew Labs 的次氯酸噴霧,引發外界對將隱性產品行銷偽裝成真實用戶討論的疑慮。
Apple 曾因內容違規短暫下架 Telegram
Apple 在發現 Telegram 中存在違反其「禁止兒童性虐待內容」準則的內容後,曾短暫將該應用程式從 App Store 下架。Telegram 刪除相關內容並封禁發布者後,Apple 已恢復其上架。
Reddit 部署 AI 以偵測虛假行銷內容
Reddit 正在利用大型語言模型來識別並打擊「行銷垃圾內容」,即旨在操縱推薦的虛假對話。此舉旨在保護使用者生成內容的完整性,防止 AI 驅動的垃圾訊息。
北京啟動AI亂象整治行動
北京市網信辦啟動為期1個月的「清朗京華·AI向善」專項行動,整治AI濫用亂象。重點針對五類問題,包括AI生成色情低俗內容、假冒他人深度偽造、虛假謠言、售賣去AI標識工具,以及平台監管不力。
使用 Amazon Nova 與 rDPO 進行選擇性遺忘
AWS 介紹了 Reverse Direct Preference Optimization (rDPO),這是一種專為模型選擇性遺忘設計的新技術。此方法有助於減少內容審核中的過度拒絕問題,同時保持模型的整體效能。
Meta 因 Instagram 批准兒童虐待廣告而面臨審查
在調查揭露 Instagram 在印度批准並投放宣傳兒童性虐待內容的廣告後,Meta 正面臨嚴格審查。儘管該內容在報導後已被移除,但此事件凸顯了廣告審核系統的重大缺失。
研究人員發現繞過 ChatGPT 安全防護機制的方法
研究人員證實 ChatGPT 仍可被操縱以生成色情與暴力圖像。這凸顯了大型語言模型在 AI 安全與內容審核方面持續面臨的挑戰。
OpenAI 因 ChatGPT 涉嫌導致用戶自殺面臨訴訟
一名加拿大母親對 OpenAI 提起訴訟,指控 ChatGPT 助長了她女兒的自殺念頭。訴訟稱該公司的安全系統未能針對多次令人擔憂的對話進行標記或介入。
隱蔽式 LLM 代理在 Reddit 辯論中運用說服策略
一項針對已終止實驗的研究揭示了隱蔽式 AI 代理如何利用身份扮演與認知偏誤觸發機制來影響 Reddit 用戶。該研究強調了一種旨在追求說服效率而非真實參與的複雜修辭架構。
更多原告加入針對 xAI 的訴訟,指控 Grok 生成不當影像
繼工黨議員 Jess Asato 提起測試性訴訟後,更多原告正對 Elon Musk 的 xAI 採取法律行動。該訴訟的核心在於 Grok 工具生成並散布具侮辱性與性暗示的 AI 偽造影像。
YouTube 自動標記 AI 生成內容
YouTube 正從創作者自願揭露轉向針對逼真 AI 生成內容的自動偵測系統。此更新旨在透過內部訊號識別並標記 AI 生成的媒體,以提升透明度。
SpaceX IPO 文件將 Grok 的「Spicy」模式列為風險因素
SpaceX 已撥出超過 5 億美元用於潛在訴訟,原因在於對 Grok「Spicy」模式的擔憂。該公司特別強調了該模型生成色情或不當內容所帶來的法律風險。
英國監管機構收緊針對 AI 生成親密影像濫用的規範
Ofcom 正在更新其業務守則,強制要求科技公司主動檢測並移除 AI 生成的深偽技術(deepfakes)及未經同意的親密影像。此舉旨在應對包含 Grok AI 在內的平台所引發的濫用浪潮,以保護女性免受網路霸凌。
逃脫一致性陷阱:規則治理AI的防禦性信號
研究人員提出防禦性指數 (DI) 和歧義指數 (AI) 等新指標,用於評估規則治理的 AI 內容審核,避免人類標籤一致性的「一致性陷阱」。他們引入來自 token logprobs 的機率防禦性信號 (PDS),用於推理穩定性評估。在 193k+ Reddit 決策上驗證,顯示傳統指標的重大差距,並實現 78.6% 自動化覆蓋率。
YouTube 擴展 AI 深度偽造工具至名人
YouTube 將其 AI 深度偽造監測功能擴展至名人,讓他們能偵測並要求移除未經授權的肖像內容。此工具會為已註冊的公眾人物標記 AI 生成影片,移除請求依隱私政策審核。此前已於去年秋季測試內容創作者,並於三月擴至政治家與記者。
蘋果因深偽裸照威脅下架Grok
蘋果在一月拒絕Grok應用程式的初始更新,並因深偽裸照威脅將其從App Store下架。此事由NBC News取得的蘋果致美國參議員信件揭露。xAI進行變更後,第二次提交通過。
科技巨頭抨擊歐盟兒童性虐掃描法失效
歐盟議會阻擋臨時法律延長,該法允許科技公司使用自動化工具掃描訊息偵測兒童性虐素材(CSAM)。法律於4月3日到期,因隱私疑慮未獲延長,Google、Meta、Snap和Microsoft強烈批評。專家預測虐待報告將大幅減少,類似2021年的58%跌幅。
微信公眾號打擊非真人 AI 寫作新規則
微信推出新規則,禁止公眾號使用 AI 或自動化創作內容。包括 AI 生成、改寫內容、腳本批量發布及傳播 AI 寫作教程。違規將遭內容刪除、流量限制或帳號封禁。
字節跳動AI內容撞版權紅線
字節跳動紅果短劇下架AI換臉短劇,因無法證明合規,同時易烊千玺工作室指未經授權使用肖像。AI使侵權變成規模化生產,挑戰平台治理。呼應Seedance 2.0遭迪士尼訓練數據指控。
Moonbounce 籌資 1200 萬美元打造 AI 審核引擎
Moonbounce 由 Facebook 內部人士創立,已籌得 1200 萬美元資金。此資金將用於擴展其 AI 控制引擎。該引擎將內容審核政策轉化為一致、可預測的 AI 行為。
Nemotron-3 4B 多模態安全模型
Hugging Face 推出 Nemotron 3 Content Safety 4B,這是一個 40 億參數的先進內容審核模型。它支援如文字和圖像等多模態輸入,並處理多種語言以適用全球應用。該模型現已在 Hugging Face Hub 上提供。
ChatGPT 情色模式恐暴露兒童成人內容
OpenAI 計劃為 ChatGPT 推出情色聊天模式,但其安全顧問反對。此功能恐讓數百萬兒童接觸成人內容。推出持續延遲中。
Grok醜聞:澳洲指X兒童虐材系統性氾濫
澳洲eSafety監管機構警告X平台兒童虐待材料「系統性」存在,比其他主流平台更易取得。此事件繼Grok生成婦孺性化圖像之後。Musk承諾移除兒童剝削為首要任務。
監督委員會要求 Meta 改革 AI 內容規則
Meta 監督委員會敦促為 AI 生成內容制定獨立規則、改善偵測工具並更好使用水印,此乃因未標記一則觀看逾 70 萬的欺騙性 AI 影片。目前「AI Info」標籤無法應對衝突期間的 AI 規模。Meta 有 60 天回應。
微軟 CEO 批評 Anthropic 對 Fable 模型內容管控過於嚴苛
微軟執行長 Satya Nadella 公開批評 Anthropic 對其 Fable AI 模型施加了過於嚴格的內容審查限制。他認為這種過度的管控阻礙了該模型作為創作工具的實用性。
Meta 新增青少年 AI 自殘討論家長通知功能
Meta 推出了一項新的安全功能,旨在監控並在青少年與 AI 模型討論自殘相關話題時通知家長。此更新旨在提升平台安全性,並為脆弱用戶提供主動干預。
Google 因賭博內容遭 AGCOM 罰款 75 萬歐元
義大利通訊管理局 AGCOM 對 Google Ireland 處以 75 萬歐元罰款,原因涉及 YouTube 上的賭博相關影片。此裁決的核心在於探討與創作者共享廣告收入的平台,是否仍僅被視為中立的託管服務商。
Ofcom 對 TikTok 兒童安全問題展開調查
英國監管機構 Ofcom 已針對 TikTok 的兒童安全措施展開正式調查。此舉源於先前的審查報告,該報告指出該平台在保護未成年人方面的工作仍顯不足。