🗾ITmedia AI+ (日本)•最新收集於 53m
AI 公司為訓練模型大量購買數千本書

💡大規模購書與掃描揭露前沿模型訓練資料背後的著作權與來源風險。
⚡ 30-Second TL;DR
有什麼變化
一家中國 AI 公司向荷蘭古書店訂購了 3,000 本舊書。
為什麼重要
AI 開發者若使用數位化書籍或其他抓取內容訓練模型,可能面臨更高的法律與聲譽風險。這些揭露可能加速市場對授權語料庫、來源追蹤,以及更透明訓練資料揭露的需求。
下一步行動
在使用任何語料庫訓練前,透過 Hugging Face Dataset Card 記錄其授權、取得方式,以及資料刪除或保留政策。
誰應關注:Researchers & Academics
關鍵要點
- •一家中國 AI 公司向荷蘭古書店訂購了 3,000 本舊書。
- •據報 Anthropic 掃描並銷毀了數百萬本書籍。
- •相關行為引發對 AI 訓練資料採購、著作權、授權與透明度的疑問。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •AI 公司傾向採購舊書(Out-of-print books)是為了規避現行著作權法中對於流通書籍的嚴格授權限制,並獲取高品質、經過編輯的長文本資料。
- •此類大規模書籍採購行為通常涉及將實體書進行 OCR(光學字元辨識)轉換,並將其轉化為機器可讀的純文字格式,以納入大型語言模型(LLM)的預訓練語料庫。
- •針對 Anthropic 等公司的書籍處理爭議,法律專家指出,若書籍內容受版權保護,即使是為了訓練 AI 而進行的掃描與數位化,在多數司法管轄區仍可能構成侵權,除非符合「合理使用」(Fair Use)原則。
- •除了實體書籍,AI 公司亦開始轉向購買受版權保護的數位內容資料庫,例如與新聞媒體集團或學術出版商簽署授權協議,以降低法律風險並獲取即時資訊。
- •荷蘭古書店事件反映了 AI 產業鏈已延伸至傳統出版與二手書市場,導致部分稀有書籍價格上漲,並引發了關於文化遺產數位化與商業化利用的倫理辯論。
🛠️ 技術深入
- 資料預處理流程:AI 公司通常使用高解析度工業掃描器進行書籍數位化,隨後利用先進的 OCR 模型(如 Tesseract 的變體或專有模型)進行文字提取。
- 語料清洗技術:提取後的文字會經過複雜的清洗流程,包括去除頁碼、頁眉、頁腳、目錄以及重複的廣告內容,以確保訓練資料的純淨度。
- 標記化(Tokenization)策略:書籍內容被轉換為 Token 序列,並透過特殊的格式標記(如 <book_start>, <chapter_break>)來保留書籍的結構資訊,這有助於模型理解長篇敘事邏輯。
- 著作權過濾機制:部分公司在訓練前會建立雜湊值(Hash)資料庫,比對已知的受版權保護內容,以決定是否將特定書籍納入訓練集。
🔮 前景展望AI analysis grounded in cited sources
全球著作權法規將針對 AI 訓練資料採購進行重大修訂。
隨著 AI 公司大規模掃描書籍的行為引發法律訴訟,各國政府將被迫釐清「訓練資料」是否屬於著作權法中的合理使用範疇。
AI 訓練資料市場將出現「授權資料庫」的壟斷現象。
由於法律風險增加,AI 公司將更傾向於購買已取得授權的資料集,導致擁有大量版權內容的出版商在 AI 產業鏈中掌握極大的議價權。
⏳ 時間線
2023-10
Anthropic 被指控在訓練 Claude 模型時未經授權使用大量受版權保護的書籍內容。
2024-05
多個出版商與作家協會對多家 AI 公司提起集體訴訟,抗議其未經授權掃描書籍進行訓練。
2025-02
荷蘭古書店公開表示收到來自中國 AI 公司的異常大量書籍訂單,引發國際媒體關注。
2026-01
國際著作權組織發布關於 AI 訓練資料採購的指導原則,呼籲建立透明的授權機制。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ITmedia AI+ (日本) ↗
