🐯最新收集於 4m

「AI 焚書」其實比想像中複雜

「AI 焚書」其實比想像中複雜
PostLinkedIn
🐯閱讀原文: 虎嗅

💡AI 訓練可能保存書中文字,卻摧毀實體文物,揭示資料治理的隱性難題。

⚡ 30-Second TL;DR

有什麼變化

據報導,Anthropic 透過「巴拿馬計畫」投入數千萬美元,購入並破壞性掃描數百萬本實體書。

為什麼重要

對 AI 建構者而言,這場爭議顯示訓練資料取得不只是著作權問題,也涉及來源追蹤、文化保存與聲譽風險。大規模實體數位化在某些情況下可能合法,但仍可能引發嚴重的倫理疑慮。

下一步行動

在將資料加入模型訓練集前,對 OCR 資料匯入流程執行來源稽核,記錄每個來源的 ISBN、取得授權、掃描狀態與保存政策。

誰應關注:Researchers & Academics

關鍵要點

  • 據報導,Anthropic 透過「巴拿馬計畫」投入數千萬美元,購入並破壞性掃描數百萬本實體書。
  • Amazon 疑似透過 VGT3 專案進行高速拆書與掃描,顯示這種做法並非單一 AI 公司所為。
  • 掃描後的書籍會轉成包含頁面影像與機器可讀文字的 PDF,因此銷毀實體副本不一定代表知識消失。
  • 真正值得擔憂的是稀有、絕版、帶有批註或具歷史價值的版本,因為其實體價值無法被數位檔案完全取代。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 破壞性掃描流程通常涉及工業級切紙機,將書脊切除以實現高速自動進紙掃描,這使得書籍在物理上無法修復。
  • 法律界對於此類行為是否構成美國版權法下的「合理使用」(Fair Use)存在激烈爭議,特別是針對商業 AI 訓練用途。
  • 除了 Anthropic 和 Amazon,Google 在過去的圖書搜尋計畫中也曾進行大規模掃描,但其當時保留了實體副本,與現今 AI 公司的「銷毀」模式有顯著差異。
  • 出版商與作者協會已開始針對 AI 公司的數據採購來源進行審計,要求公開訓練數據集中的書籍清單以確保授權合法性。
  • 數位化後的 PDF 檔案雖然保留了文字,但往往缺乏原始實體書的排版細節、紙張紋理及裝幀工藝等「元數據」,導致數位檔案在學術研究上的價值受限。

🛠️ 技術深入

  • 掃描流程採用高解析度工業掃描儀,通常配置每分鐘可處理數百頁的自動進紙器(ADF)。
  • 影像處理階段使用 OCR(光學字元辨識)技術,結合 Layout Analysis 模型來識別段落、標題與圖片區域。
  • 為了優化模型訓練,掃描後的數據會被轉換為結構化 JSON 或 Parquet 格式,並標註元數據(Metadata)以利於模型進行上下文學習(In-context learning)。
  • 針對破壞性掃描後的影像,會進行去歪斜(Deskewing)、去噪(Denoising)與色彩校正,以確保訓練數據的品質。

🔮 前景展望AI analysis grounded in cited sources

全球圖書館與檔案館將建立「實體書保護協議」。
為防止 AI 公司大規模收購並銷毀稀有書籍,文化機構將限制對商業實體的書籍轉售。
AI 訓練數據的「版權溯源」將成為強制性標準。
監管機構將要求 AI 公司證明其訓練數據的合法來源,迫使企業轉向授權數據庫而非破壞性掃描。

時間線

2004-12
Google 圖書搜尋計畫啟動,開啟大規模書籍數位化先河。
2023-09
Anthropic 被報導開始擴大數據採購規模,引發關於訓練數據來源的討論。
2024-05
多位作家與出版商對 AI 公司提起訴訟,質疑未經授權的書籍掃描行為。
2025-02
Amazon 內部專案 VGT3 的細節流出,證實科技巨頭在硬體層面投入資源進行高速掃描。
2026-03
產業報告指出「巴拿馬計畫」已完成數百萬冊書籍的處理,引發文化保存界的強烈抗議。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅