
AI 開始為倒閉公司的資料定價
據報 Google 在 Spirit Airlines 的破產資產拍賣中,以1000萬美元競標其企業內部資料,包括約1億封電子郵件與5億則 Microsoft Teams 訊息。這筆交易顯示,一個收購並清理企業溝通與工作紀錄、用於訓練 AI 系統及企業 Agent 的新市場正在形成。
Tag: #training-data64 results

據報 Google 在 Spirit Airlines 的破產資產拍賣中,以1000萬美元競標其企業內部資料,包括約1億封電子郵件與5億則 Microsoft Teams 訊息。這筆交易顯示,一個收購並清理企業溝通與工作紀錄、用於訓練 AI 系統及企業 Agent 的新市場正在形成。

Anna’s Archive 的一名志工呼籲大眾掃描並上傳實體書籍,以保存公眾取得人類知識的權利。這項行動源於對 AI 公司購買、掃描並銷毀書籍以更快建立訓練資料的指控。

MIT 研究發現,AI 生成的影像通常無法追溯至單一訓練影像。隨著資料集規模擴大,任何特定範例的影響力往往會逐漸減弱。
文章稱 Anthropic 與 Amazon 疑似大量購買實體書籍,掃描後銷毀原件,以降低 AI 訓練資料的著作權風險。文章指出,這種策略與美國和中國著作權法的差異有關,同時也引發對文化載體不可逆損失的憂慮。

圖靈獎得主 Richard Sutton 批評 AI 產業日益依賴合成資料來應對訓練資料短缺。在 Sequoia Capital 的 Training Data 播客中,他稱這項轉向是「一個大錯誤」。

Google 在破產拍賣中以 1,000 萬美元購入 Spirit Airlines 的資料,內容包括通訊紀錄、營運資料、程式碼、演算法、定價資料與交易資訊。Google 表示,第三方會先移除個人識別資訊,再將資料用於改善產品與 AI 模型。

據報導,Google 以一千萬美元得標美國破產法院拍賣的 Spirit Airlines 資料資產。這筆收購據稱包括數億封電子郵件與 Microsoft Teams 聊天紀錄、數十億筆航班定價及交易資料,以及經匿名化的乘客資訊,可用於 AI 訓練。

文章指出,隨著 AI 模型持續擴大並拓展至多模態應用,高品質且可合法使用的訓練資料正逐漸稀缺。出版商與內容擁有者可能因此取得新的議價能力,但版權複雜性、資料工程成本、合成資料與模型效率提升,仍可能限制其定價權。

五家主要書籍出版商及作者 Scott Turow 對 Meta 提起集體訴訟,指控其在訓練 Llama AI 模型時大規模侵權。他們稱 Meta 從 LibGen、Sci-Hub 和 Anna's Archive 等盜版網站複製書籍與期刊,無許可使用。此訴訟突顯 AI 資料來源日益增加的法律審查。

大英百科全書與美瑞典韋氏辭典起訴 OpenAI 侵害版權。他們指稱 OpenAI 未經許可使用近 10 萬篇文章訓練大型語言模型。