Cloudflare 預設封鎖 AI 爬蟲
自 9 月 15 日起,Cloudflare 將為所有使用其服務的網站預設封鎖 AI 訓練爬蟲。此舉迫使 AI 公司必須為獲取數據進行談判,並為內容創作者引入了新的「按使用付費」模式。
Tag: #web-scraping26 results
自 9 月 15 日起,Cloudflare 將為所有使用其服務的網站預設封鎖 AI 訓練爬蟲。此舉迫使 AI 公司必須為獲取數據進行談判,並為內容創作者引入了新的「按使用付費」模式。

Cloudflare 將從 9 月起實施一項新政策,封鎖 AI 爬蟲。此舉旨在強制 AI 公司為用於訓練模型的內容向網站擁有者支付報酬。

一名網頁爬蟲開發者成功挑戰了 Google 與 Reddit 利用 DMCA 下架機制封鎖資料抓取的行為。此判決突顯了平台資料控制權與網際網路資訊公開存取之間的持續緊張關係。

Cloudflare 推出一項新功能,讓網站擁有者能輕鬆封鎖 AI 網路爬蟲。此舉旨在賦予內容創作者與企業更多控制權,以決定其數據是否被用於 AI 模型訓練。

Firecrawl 現已登陸 Vercel Marketplace,讓開發者能將結構化網頁數據抓取功能直接整合至 AI 工作流中。此整合支援將網站內容轉換為 LLM 可用的格式,且無需自行維護抓取基礎設施。

Nimble 推出企業級代理搜尋平台,宣稱將公開網路資料轉換為可信 AI 輸入,準確率達 99%。該平台獲得 4700 萬美元 B 輪融資支持,使用多代理架構即時搜尋、導航、解析、處理並驗證網路資料。這解決了大型語言模型在不可驗證外部資訊上的限制。

Nimble 籌得 4700 萬美元,用以讓 AI 代理存取即時網路資料。其 AI 代理會搜尋網路、驗證結果、清潔並結構化資料成可查詢表格,如資料庫般使用。

Apple ML 質疑使用單一固定 HTML 提取器處理網路規模 LLM 預訓練資料集,指出其對多樣網路內容的涵蓋不足。不同提取器雖在語言任務上模型表現相似,但過濾後存活頁面差異巨大。此研究探討改善提取實務以提升資料利用率。

AWS 示範如何使用 Amazon Bedrock AgentCore Browser 建立自動化網站洞察擷取流程。此方案可監控 RSS feed、可靠地載入網頁、透過 Amazon Bedrock 擷取洞察,並將結果索引至 Amazon OpenSearch Serverless。

Patreon 正從被動的 robots.txt 請求轉向主動封鎖 AI 爬蟲。透過與 Cloudflare 合作,該平台旨在防止未經授權的 AI 模型訓練使用創作者內容。