📊較早收集於 19m

新聞機構阻AI訓練網路檔案

PostLinkedIn
📊閱讀原文: Bloomberg Technology

💡新聞巨頭封鎖AI訓練網路檔案—立即檢查資料來源!(20字)

⚡ 30-Second TL;DR

有什麼變化

CNN、NBC、USA Today限制網路檔案儲存

為什麼重要

可能限制AI訓練的公共網路資料可用性,迫使公司尋求授權資料集或面臨法律風險。影響依賴網路爬取的LLM開發。

下一步行動

審核訓練資料集中的新聞內容,並實施出版商封鎖的退出檢查。

誰應關注:Researchers & Academics

關鍵要點

  • CNN、NBC、USA Today限制網路檔案儲存
  • 檔案用於AI聊天機器人訓練資料
  • 保護新聞內容免於AI擷取

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 新聞機構主要透過更新網站的 robots.txt 檔案,明確禁止 OpenAI、Google 等 AI 公司的網路爬蟲(Web Crawlers)存取其內容。
  • 此舉反映了新聞出版商與 AI 開發商之間關於「公平使用」(Fair Use)原則的法律爭議,出版商主張其內容受版權保護,不應被免費用於訓練商業模型。
  • 除了封鎖爬蟲,部分新聞機構正轉向與 AI 公司簽署付費授權協議,以換取其內容被合法用於訓練資料集,將 AI 視為潛在的授權收入來源。

🔮 前景展望AI analysis grounded in cited sources

AI 模型訓練資料的透明度將面臨更嚴格的監管要求。
隨著新聞機構集體封鎖,AI 公司將被迫揭露訓練資料來源,以應對日益增加的版權訴訟壓力。
新聞網站的搜尋引擎排名可能受到影響。
透過 robots.txt 封鎖 AI 爬蟲可能會同時影響搜尋引擎對網站內容的索引效率,進而改變流量來源結構。

時間線

2023-08
紐約時報更新服務條款,明確禁止將其內容用於訓練 AI 模型。
2023-09
CNN、紐約時報與路透社等媒體開始在 robots.txt 中封鎖 OpenAI 的 GPTBot。
2024-05
新聞集團(News Corp)與 OpenAI 達成多年期內容授權協議。
2025-02
多個新聞機構聯合向美國聯邦法院提出關於 AI 訓練資料版權歸屬的訴訟。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Bloomberg Technology