來源近期收集於 10h

Cloudflare 將搜尋曝光與 AI 訓練分開

閱讀原文: Cloudflare Blog
#web-crawling#content-rights#ai-training

新控制功能可能讓出版商阻止 AI 訓練,同時不從搜尋結果消失。

30 秒速覽

有什麼變化

網站持有人可允許搜尋曝光,同時阻止 AI 訓練使用內容。

為什麼重要

這可能讓出版商更精細地控制爬蟲如何使用其內容。AI 開發者可能需要更新爬蟲政策,並遵守新的機器可讀權限。

下一步行動

在收集出版商內容前,檢查你的爬蟲與資料集匯入流程是否支援 Cloudflare 的新訓練權限。

誰應關注:Developers & AI Engineers

關鍵要點

  • 網站持有人可允許搜尋曝光,同時阻止 AI 訓練使用內容。
  • Cloudflare 正新增 Accountable 標示。
  • 此方案與 Apple、Google 及 Microsoft 共同發展。
  • 這些控制措施針對網路曝光與內容使用之間的衝突。
關鍵數字1%17%20%36%

深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

增強重點摘要

  • 全面淘汰舊有的「Block AI Bots」等一刀切開關與託管 robots.txt,改為將爬蟲流量細分為「搜尋」、「代理人」與「模型訓練」三大類別進行個別管控。
  • 針對新上線網域導入基於營利模式的預設規則:廣告支援網站預設允許搜尋、禁止 AI 訓練並於廣告頁面封鎖代理人;非營利網站則預設全數允許。
  • 針對 OpenAI、Anthropic、Meta 與 Amazon 等已獨立拆分搜尋與訓練 User-Agent 的業者,Cloudflare 能直接在邊緣節點阻擋訓練爬蟲,完全不干擾搜尋功能。
  • 根據 Cloudflare 內部遙測數據顯示,平台中主動封鎖搜尋爬蟲的網站低於 1%,但已有約 17% 的網站積極開啟阻擋 AI 訓練的設定。
  • 憑藉服務全球逾 20% 網站與 36% 熱門網站的龐大網絡優勢,Cloudflare 藉由調整預設行為推動大型科技業者遵守 IETF 的 ai-prefs 草案標準。

技術深入

  • 三維流量分類架構:廢除單一封鎖開關,將邊緣網路流量精確歸納為搜尋(Search)、代理人(Agents)與訓練(Training)三種用途。
  • 邊緣 User-Agent 精準過濾:針對已解耦爬蟲身分的純 AI 廠商(如 OpenAI 的 GPTBot),直接在 CDN 邊緣節點攔截訓練端流量,確保檢索與搜尋曝光不受影響。
  • Accountable 標籤與混合爬蟲協調:針對兼具搜尋與訓練功能的混合型爬蟲(如 Googlebot、Bingbot、Applebot),依據業者承諾之 robots.txt 標頭指示與片段規範,放行搜尋索引同時過濾訓練資料擷取。
  • 支援新興網路標準:推動並整合 IETF ai-prefs 草案規格,將發布商的版權與訓練授權偏好轉化為邊緣可執行的通用規則。

前景展望基於引用來源的 AI 分析

出版商將可細緻掌控 AI 生成摘要的內容揭露比例
Cloudflare 計畫於 2027 年初推出 AI 摘要控制功能,使網站管理者能直接從後台設定 AI 搜尋引擎的引述程度,告別二元化的全站封鎖模式。
搜尋與 AI 訓練爬蟲的身分解耦將成為產業強制標準
在邊緣網路預設阻擋訓練與 IETF 規格推廣下,未分離訓練與搜尋 User-Agent 的混合爬蟲營運商將面臨被全面邊緣化或誤擋的風險。

時間線

2026-07
Cloudflare 宣布「內容獨立日」架構,要求爬蟲營運商於 11 週內建立透明的訓練退出機制
2026-09
正式推出「Disallow AI Training」功能與 Accountable 標示,並為新網域建立基於商業模式的預設規則

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Cloudflare Blog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。