🐯虎嗅•最新收集於 4m
「AI 焚書」其實比想像中複雜

#training-data#copyright#digital-preservation#data-governanceanthropic-panama-plananthropicamazonisbndb
💡AI 訓練可能保存書中文字,卻摧毀實體文物,揭示資料治理的隱性難題。
⚡ 30-Second TL;DR
有什麼變化
據報導,Anthropic 透過「巴拿馬計畫」投入數千萬美元,購入並破壞性掃描數百萬本實體書。
為什麼重要
對 AI 建構者而言,這場爭議顯示訓練資料取得不只是著作權問題,也涉及來源追蹤、文化保存與聲譽風險。大規模實體數位化在某些情況下可能合法,但仍可能引發嚴重的倫理疑慮。
下一步行動
在將資料加入模型訓練集前,對 OCR 資料匯入流程執行來源稽核,記錄每個來源的 ISBN、取得授權、掃描狀態與保存政策。
誰應關注:Researchers & Academics
關鍵要點
- •據報導,Anthropic 透過「巴拿馬計畫」投入數千萬美元,購入並破壞性掃描數百萬本實體書。
- •Amazon 疑似透過 VGT3 專案進行高速拆書與掃描,顯示這種做法並非單一 AI 公司所為。
- •掃描後的書籍會轉成包含頁面影像與機器可讀文字的 PDF,因此銷毀實體副本不一定代表知識消失。
- •真正值得擔憂的是稀有、絕版、帶有批註或具歷史價值的版本,因為其實體價值無法被數位檔案完全取代。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •破壞性掃描流程通常涉及工業級切紙機,將書脊切除以實現高速自動進紙掃描,這使得書籍在物理上無法修復。
- •法律界對於此類行為是否構成美國版權法下的「合理使用」(Fair Use)存在激烈爭議,特別是針對商業 AI 訓練用途。
- •除了 Anthropic 和 Amazon,Google 在過去的圖書搜尋計畫中也曾進行大規模掃描,但其當時保留了實體副本,與現今 AI 公司的「銷毀」模式有顯著差異。
- •出版商與作者協會已開始針對 AI 公司的數據採購來源進行審計,要求公開訓練數據集中的書籍清單以確保授權合法性。
- •數位化後的 PDF 檔案雖然保留了文字,但往往缺乏原始實體書的排版細節、紙張紋理及裝幀工藝等「元數據」,導致數位檔案在學術研究上的價值受限。
🛠️ 技術深入
- 掃描流程採用高解析度工業掃描儀,通常配置每分鐘可處理數百頁的自動進紙器(ADF)。
- 影像處理階段使用 OCR(光學字元辨識)技術,結合 Layout Analysis 模型來識別段落、標題與圖片區域。
- 為了優化模型訓練,掃描後的數據會被轉換為結構化 JSON 或 Parquet 格式,並標註元數據(Metadata)以利於模型進行上下文學習(In-context learning)。
- 針對破壞性掃描後的影像,會進行去歪斜(Deskewing)、去噪(Denoising)與色彩校正,以確保訓練數據的品質。
🔮 前景展望AI analysis grounded in cited sources
全球圖書館與檔案館將建立「實體書保護協議」。
為防止 AI 公司大規模收購並銷毀稀有書籍,文化機構將限制對商業實體的書籍轉售。
AI 訓練數據的「版權溯源」將成為強制性標準。
監管機構將要求 AI 公司證明其訓練數據的合法來源,迫使企業轉向授權數據庫而非破壞性掃描。
⏳ 時間線
2004-12
Google 圖書搜尋計畫啟動,開啟大規模書籍數位化先河。
2023-09
Anthropic 被報導開始擴大數據採購規模,引發關於訓練數據來源的討論。
2024-05
多位作家與出版商對 AI 公司提起訴訟,質疑未經授權的書籍掃描行為。
2025-02
Amazon 內部專案 VGT3 的細節流出,證實科技巨頭在硬體層面投入資源進行高速掃描。
2026-03
產業報告指出「巴拿馬計畫」已完成數百萬冊書籍的處理,引發文化保存界的強烈抗議。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗



