🐯最新收集於 25m

為什麼 AI 公司要銷毀正版書籍?

PostLinkedIn
🐯閱讀原文: 虎嗅

💡AI 資料管線可能因保留或銷毀實體原件,而面臨不同的著作權風險。

⚡ 30-Second TL;DR

有什麼變化

文章稱 Anthropic 代號為 Panama 的內部專案會切除書脊、掃描頁面,再銷毀實體副本。

為什麼重要

如果相關做法屬實,可能影響 AI 公司設計授權資料管線及記錄著作權合規流程。這也凸顯高效取得語料、模型競爭力與文化資料保存之間的矛盾。

下一步行動

在使用受著作權保護的文字訓練模型前,請按司法管轄區審查語料庫,並保留來源、授權、掃描紀錄與刪除紀錄。

誰應關注:Founders & Product Leaders

關鍵要點

  • 文章稱 Anthropic 代號為 Panama 的內部專案會切除書脊、掃描頁面,再銷毀實體副本。
  • 該策略被描述為:以合法購買的實體副本為基礎,建立可主張為替代品的數位副本,以降低美國著作權風險。
  • 文章將破壞式掃描與 Google 非破壞性的 Google Books 方法,以及 SpaceX AI 據稱對珍貴書籍的處理方式作比較。
  • 依文章對中國法律的解讀,購買並銷毀書籍並不代表可未經授權掃描書籍,用於商業模型訓練。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 法律界對於『銷毀實體書以換取數位副本』是否構成美國著作權法下的『合理使用』(Fair Use)存在高度爭議,目前尚無明確判例支持此種大規模掃描行為。
  • 此類『切書掃描』(Book Cutting)流程通常涉及第三方專業掃描服務商,這些服務商在處理受版權保護材料時,面臨與 AI 公司共同承擔侵權責任的法律風險。
  • 除了 Anthropic,其他 AI 實驗室亦被指控利用類似的『影子圖書館』(Shadow Libraries)數據集進行訓練,這些數據集往往包含未經授權的數位化書籍。
  • 美國出版商協會(AAP)及多位作家已針對 AI 公司未經授權使用受版權保護書籍提起多起集體訴訟,核心爭點在於 AI 訓練是否屬於『轉換性使用』(Transformative Use)。
  • 此類行為引發了關於『數位保存』與『著作權保護』之間的衝突,圖書館界擔心這種破壞性掃描會導致珍貴文獻的實體遺產永久消失。

🛠️ 技術深入

  • 掃描流程通常採用工業級高速掃描儀,並結合 OCR(光學字元辨識)技術將實體頁面轉化為機器可讀的純文字格式(通常為 JSON 或 TXT)。
  • 為了優化模型訓練,掃描後的數據會進行去重、清洗與格式化,以去除頁碼、頁眉、頁腳等雜訊,確保訓練語料的純淨度。
  • 該過程涉及將實體書的版權頁與元數據(Metadata)進行標註,以便在訓練過程中進行版權過濾或權重調整。

🔮 前景展望AI analysis grounded in cited sources

AI 公司將面臨更嚴格的數據來源審計要求。
隨著版權訴訟增加,監管機構可能要求 AI 開發商公開訓練數據集來源,迫使企業轉向授權數據庫。
出版業將大規模採用數位版權管理(DRM)技術保護訓練數據。
為防止 AI 公司未經授權抓取內容,出版商將在數位書籍中嵌入不可見的追蹤標記或加密技術。

時間線

2023-09
Anthropic 與 Amazon 達成戰略合作,獲得大量雲端運算資源與數據處理支持。
2024-01
多位知名作家對 AI 公司提起集體訴訟,指控其未經授權使用書籍訓練模型。
2025-05
關於 AI 訓練數據合法性的法律辯論升級,涉及『切書掃描』的內部操作流程細節開始在媒體曝光。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅