🤖Reddit r/MachineLearning•較早收集於 27m
如何獲取用於研究的 Books3 資料集
💡了解用於大型語言模型訓練、極具爭議的 Books3 資料集目前的獲取狀態。
⚡ 30-Second TL;DR
有什麼變化
Books3 是一個用於訓練大型語言模型的大規模書籍資料集。
為什麼重要
Books3 的可用性顯著影響了研究人員訓練長文本模型的方式。對該資料集的法律限制可能會迫使研究轉向授權或公有領域的資料來源。
下一步行動
在訓練流程中使用如 Books3 這類爬取資料集前,請諮詢貴單位的法律顧問,以避免潛在的版權責任。
誰應關注:Researchers & Academics
關鍵要點
- •Books3 是一個用於訓練大型語言模型的大規模書籍資料集。
- •該資料集目前正因版權侵權問題面臨法律審查。
- •在廣泛下架的情況下,研究人員正在尋找合法的獲取途徑。
🧠 深度解析
本篇為 AI 生成分析,非原文內容。
🔑 增強重點摘要
- •Books3 是由 AI 研究員 Shawn Presser 於 2020 年發布,作為 EleutherAI 的 The Pile 資料集的一部分,旨在提供公開的書籍文本以促進 AI 研究民主化。
- •該資料集實際上是從 Bibliotik 等盜版電子書網站的數據庫中抓取而來,這直接導致了其後續的法律爭議與下架。
- •Meta 的 LLaMA 模型早期版本被證實使用了 Books3 進行訓練,這使其成為多起針對 AI 公司版權訴訟的核心證據。
- •2023 年,在版權保護組織(如 Authors Guild)的壓力下,The Eye 等託管平台移除了 Books3,導致該資料集在主流學術渠道中斷。
- •目前學術界轉向使用如 Project Gutenberg 或由出版商授權的數據集,以規避 Books3 帶來的法律與倫理風險。
📊 競品分析▸ Show
| 資料集名稱 | 來源合法性 | 規模/內容 | 主要用途 |
|---|---|---|---|
| Books3 | 具爭議 (盜版抓取) | 約 19.7 萬本書 | 大規模語言模型預訓練 |
| Project Gutenberg | 高 (公有領域) | 約 7 萬本電子書 | 學術研究、語言模型訓練 |
| C4 (Colossal Clean Crawled Corpus) | 中 (網頁抓取) | 數千億 token | 通用語言模型訓練 |
| Pile (Books3 移除版) | 高 | 多源數據集合 | 開源模型訓練基準 |
🛠️ 技術深入
- 資料集格式:主要由純文本文件組成,經過清洗以去除重複內容與格式錯誤。
- 數據組成:包含大量受版權保護的現代小說、非虛構類書籍,與 Project Gutenberg 的公有領域數據有顯著差異。
- 訓練影響:在模型訓練中,Books3 被認為對提升模型在長文本理解與敘事連貫性方面具有顯著貢獻。
- 數據處理:原始數據經過了去重(deduplication)處理,以減少模型對特定文本的過度擬合。
🔮 前景展望AI analysis grounded in cited sources
AI 訓練數據的『數據溯源』將成為法律合規的強制標準。
Books3 的訴訟案例迫使開發者必須建立完整的數據來源審計鏈,以應對日益嚴格的版權審查。
未來的大型語言模型將更依賴於授權數據集而非大規模抓取數據。
法律風險與潛在的賠償成本使得企業轉向與出版商簽署數據授權協議,而非承擔侵權風險。
⏳ 時間線
2020-12
EleutherAI 發布 The Pile,其中包含 Books3 資料集。
2023-08
The Eye 應版權要求下架 Books3 資料集。
2023-09
Authors Guild 對 OpenAI 等公司提起訴訟,引用 Books3 作為侵權證據。
2024-02
法院開始審理關於 AI 訓練數據是否構成合理使用(Fair Use)的關鍵動議。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週 AI 簡報
每週一封,可隨時退訂。