
OriginBlame:用於 AI 模型遺忘的精確數據溯源系統
OriginBlame (ob) 是一個全新的數據溯源系統,能在記錄與 Token 層級追蹤數據,以精確處理作者的資料刪除請求。相較於檔案層級的方法,它大幅減少了過度刪除的情況,並提升了模型遺忘(unlearning)的成效。
Tag: #data-provenance18 results

OriginBlame (ob) 是一個全新的數據溯源系統,能在記錄與 Token 層級追蹤數據,以精確處理作者的資料刪除請求。相較於檔案層級的方法,它大幅減少了過度刪除的情況,並提升了模型遺忘(unlearning)的成效。

文章探討 AI 生成的答案如何減少人類對 Stack Overflow 等公共知識平台的貢獻,可能造成訓練資料供應萎縮與老化。文章並結合模型崩潰研究指出,反覆使用 AI 生成資料進行訓練,可能使輸出變得更單調,並逐漸偏離真實世界。

一家荷蘭古書店收到中國 AI 公司訂購 3,000 本書的訂單,推測用途是建立訓練資料。報導也揭露 Anthropic 曾掃描並銷毀數百萬本書,凸顯 AI 資料集建置流程的不透明,以及其中可能引發的爭議。

Amazon 表示,除非使用者採取措施退出,否則任何在 Twitch 上播出的影片都可能被用於訓練生成式 AI。這項披露引發觀眾與內容創作者的反彈,他們擔心內容使用的同意權與控制權。

書商懷疑 AI 公司正悄悄大量購買稀有書籍,可能是為了取得訓練資料後銷毀實體書籍。這些指控引發書商反彈,也加深了外界對資料取得透明度與文化保存的疑慮。

歐洲各地的獨立書店收到大量訂購冷門書籍的異常訂單,而這些書近年幾乎沒有需求。賣家懷疑 AI 公司可能為取得更多 LLM 訓練資料而收購書籍,也擔心這些書最終可能被銷毀。

OpenAI 將 Apple 提起的商業機密訴訟形容為咄咄逼人且異常針對個人。這家 ChatGPT 開發商表示,自己既沒有也不想要 Apple 的任何商業機密。

某學術期刊撤回了物理學家 Max Planck 於 1940 年代發表的兩篇論文。此舉導致相關內容被移除,目前僅剩空白頁面與空的 PDF 檔案。