📰The Verge•較早收集於 13m
Meta 遭出版商起訴 Llama 訓練版權侵權

💡LLM 訓練盜版資料關鍵訴訟—開發者合規必讀警示。
⚡ 30-Second TL;DR
有什麼變化
出版商 Macmillan、McGraw-Hill、Elsevier、Hachette、Cengage 及作者 Scott Turow 起訴 Meta。
為什麼重要
此訴訟可能為 AI 訓練資料使用設立法律先例,促使公司轉向授權資料集並提高開發成本。它強調影子圖書館風險,影響產業倫理 AI 實務。
下一步行動
審查訓練資料集是否來自盜版網站來源,並轉換至授權替代如 Common Crawl 子集。
誰應關注:Enterprise & Security Teams
關鍵要點
- •出版商 Macmillan、McGraw-Hill、Elsevier、Hachette、Cengage 及作者 Scott Turow 起訴 Meta。
- •指控從 LibGen、Sci-Hub、Anna's Archive 等盜版網站複製受版權保護書籍/期刊。
- •無許可用於訓練 Llama AI 模型。
- •稱為歷史上最龐大版權侵權之一。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •原告指控 Meta 在其名為「Books3」的數據集中使用了數十萬本受版權保護的書籍,該數據集被廣泛認為是從非法影子圖書館中獲取的。
- •Meta 在法庭文件中辯稱,其訓練過程屬於美國版權法下的「合理使用」(Fair Use),強調模型學習的是語言模式而非複製內容。
- •此案與其他針對 AI 公司的訴訟不同之處在於,原告明確指出了 Meta 內部關於使用盜版數據的溝通紀錄,試圖證明其明知侵權仍持續訓練。
📊 競品分析▸ Show
| 特色/比較 | Meta (Llama) | OpenAI (GPT) | Anthropic (Claude) |
|---|---|---|---|
| 訓練數據透明度 | 爭議中,面臨版權訴訟 | 拒絕公開具體數據集 | 採取較嚴格的數據篩選 |
| 模型架構 | 開放權重 (Open Weights) | 閉源 (Closed Source) | 閉源 (Closed Source) |
| 法律風險 | 高 (因數據來源爭議) | 中高 (面臨多項版權訴訟) | 中 (強調安全與合規) |
🛠️ 技術深入
- •Llama 系列模型採用 Transformer 解碼器架構,並針對大規模語料庫進行預訓練。
- •訓練數據集包含 Common Crawl、Wikipedia、GitHub 以及被指控的 Books3 等來源。
- •模型訓練過程涉及將文本轉化為 Token,並通過自回歸(Autoregressive)方式預測下一個 Token,此過程被 Meta 辯稱為「轉換性使用」(Transformative Use)。
- •Meta 在訓練過程中使用了大規模的 GPU 集群(如 H100),並針對不同規模的模型(如 8B, 70B, 405B)進行了參數優化。
🔮 前景展望AI analysis grounded in cited sources
AI 訓練數據的「合理使用」定義將在美國司法體系中確立明確判例。
此案的判決結果將直接影響所有大型語言模型開發商未來獲取訓練數據的法律成本與合規門檻。
出版商將加速建立 AI 授權數據市場。
面對持續的法律壓力,科技公司可能被迫轉向與出版商簽署付費授權協議,以確保訓練數據的合法性。
⏳ 時間線
2023-02
Meta 正式發布 Llama 第一代模型,隨後引發關於訓練數據來源的初步質疑。
2023-07
Meta 發布 Llama 2,進一步擴大訓練數據規模,版權爭議隨之升溫。
2024-04
Meta 發布 Llama 3,並宣稱其訓練數據量達到 15 兆個 Token。
2025-09
五家出版商與 Scott Turow 正式對 Meta 提起集體訴訟,指控其大規模侵權。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: The Verge ↗

