
研究人員發現繞過 ChatGPT 安全防護機制的方法
研究人員證實 ChatGPT 仍可被操縱以生成色情與暴力圖像。這凸顯了大型語言模型在 AI 安全與內容審核方面持續面臨的挑戰。
Tag: #content-moderation244 results

研究人員證實 ChatGPT 仍可被操縱以生成色情與暴力圖像。這凸顯了大型語言模型在 AI 安全與內容審核方面持續面臨的挑戰。

一名加拿大母親對 OpenAI 提起訴訟,指控 ChatGPT 助長了她女兒的自殺念頭。訴訟稱該公司的安全系統未能針對多次令人擔憂的對話進行標記或介入。

一項針對已終止實驗的研究揭示了隱蔽式 AI 代理如何利用身份扮演與認知偏誤觸發機制來影響 Reddit 用戶。該研究強調了一種旨在追求說服效率而非真實參與的複雜修辭架構。

繼工黨議員 Jess Asato 提起測試性訴訟後,更多原告正對 Elon Musk 的 xAI 採取法律行動。該訴訟的核心在於 Grok 工具生成並散布具侮辱性與性暗示的 AI 偽造影像。

YouTube 正從創作者自願揭露轉向針對逼真 AI 生成內容的自動偵測系統。此更新旨在透過內部訊號識別並標記 AI 生成的媒體,以提升透明度。

SpaceX 已撥出超過 5 億美元用於潛在訴訟,原因在於對 Grok「Spicy」模式的擔憂。該公司特別強調了該模型生成色情或不當內容所帶來的法律風險。

Ofcom 正在更新其業務守則,強制要求科技公司主動檢測並移除 AI 生成的深偽技術(deepfakes)及未經同意的親密影像。此舉旨在應對包含 Grok AI 在內的平台所引發的濫用浪潮,以保護女性免受網路霸凌。

研究人員提出防禦性指數 (DI) 和歧義指數 (AI) 等新指標,用於評估規則治理的 AI 內容審核,避免人類標籤一致性的「一致性陷阱」。他們引入來自 token logprobs 的機率防禦性信號 (PDS),用於推理穩定性評估。在 193k+ Reddit 決策上驗證,顯示傳統指標的重大差距,並實現 78.6% 自動化覆蓋率。

YouTube 將其 AI 深度偽造監測功能擴展至名人,讓他們能偵測並要求移除未經授權的肖像內容。此工具會為已註冊的公眾人物標記 AI 生成影片,移除請求依隱私政策審核。此前已於去年秋季測試內容創作者,並於三月擴至政治家與記者。

蘋果在一月拒絕Grok應用程式的初始更新,並因深偽裸照威脅將其從App Store下架。此事由NBC News取得的蘋果致美國參議員信件揭露。xAI進行變更後,第二次提交通過。