🗾最新收集於 53m

AI 公司為訓練模型大量購買數千本書

AI 公司為訓練模型大量購買數千本書
PostLinkedIn
🗾閱讀原文: ITmedia AI+ (日本)

💡大規模購書與掃描揭露前沿模型訓練資料背後的著作權與來源風險。

⚡ 30-Second TL;DR

有什麼變化

一家中國 AI 公司向荷蘭古書店訂購了 3,000 本舊書。

為什麼重要

AI 開發者若使用數位化書籍或其他抓取內容訓練模型,可能面臨更高的法律與聲譽風險。這些揭露可能加速市場對授權語料庫、來源追蹤,以及更透明訓練資料揭露的需求。

下一步行動

在使用任何語料庫訓練前,透過 Hugging Face Dataset Card 記錄其授權、取得方式,以及資料刪除或保留政策。

誰應關注:Researchers & Academics

關鍵要點

  • 一家中國 AI 公司向荷蘭古書店訂購了 3,000 本舊書。
  • 據報 Anthropic 掃描並銷毀了數百萬本書籍。
  • 相關行為引發對 AI 訓練資料採購、著作權、授權與透明度的疑問。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • AI 公司傾向採購舊書(Out-of-print books)是為了規避現行著作權法中對於流通書籍的嚴格授權限制,並獲取高品質、經過編輯的長文本資料。
  • 此類大規模書籍採購行為通常涉及將實體書進行 OCR(光學字元辨識)轉換,並將其轉化為機器可讀的純文字格式,以納入大型語言模型(LLM)的預訓練語料庫。
  • 針對 Anthropic 等公司的書籍處理爭議,法律專家指出,若書籍內容受版權保護,即使是為了訓練 AI 而進行的掃描與數位化,在多數司法管轄區仍可能構成侵權,除非符合「合理使用」(Fair Use)原則。
  • 除了實體書籍,AI 公司亦開始轉向購買受版權保護的數位內容資料庫,例如與新聞媒體集團或學術出版商簽署授權協議,以降低法律風險並獲取即時資訊。
  • 荷蘭古書店事件反映了 AI 產業鏈已延伸至傳統出版與二手書市場,導致部分稀有書籍價格上漲,並引發了關於文化遺產數位化與商業化利用的倫理辯論。

🛠️ 技術深入

  • 資料預處理流程:AI 公司通常使用高解析度工業掃描器進行書籍數位化,隨後利用先進的 OCR 模型(如 Tesseract 的變體或專有模型)進行文字提取。
  • 語料清洗技術:提取後的文字會經過複雜的清洗流程,包括去除頁碼、頁眉、頁腳、目錄以及重複的廣告內容,以確保訓練資料的純淨度。
  • 標記化(Tokenization)策略:書籍內容被轉換為 Token 序列,並透過特殊的格式標記(如 <book_start>, <chapter_break>)來保留書籍的結構資訊,這有助於模型理解長篇敘事邏輯。
  • 著作權過濾機制:部分公司在訓練前會建立雜湊值(Hash)資料庫,比對已知的受版權保護內容,以決定是否將特定書籍納入訓練集。

🔮 前景展望AI analysis grounded in cited sources

全球著作權法規將針對 AI 訓練資料採購進行重大修訂。
隨著 AI 公司大規模掃描書籍的行為引發法律訴訟,各國政府將被迫釐清「訓練資料」是否屬於著作權法中的合理使用範疇。
AI 訓練資料市場將出現「授權資料庫」的壟斷現象。
由於法律風險增加,AI 公司將更傾向於購買已取得授權的資料集,導致擁有大量版權內容的出版商在 AI 產業鏈中掌握極大的議價權。

時間線

2023-10
Anthropic 被指控在訓練 Claude 模型時未經授權使用大量受版權保護的書籍內容。
2024-05
多個出版商與作家協會對多家 AI 公司提起集體訴訟,抗議其未經授權掃描書籍進行訓練。
2025-02
荷蘭古書店公開表示收到來自中國 AI 公司的異常大量書籍訂單,引發國際媒體關注。
2026-01
國際著作權組織發布關於 AI 訓練資料採購的指導原則,呼籲建立透明的授權機制。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ITmedia AI+ (日本)