
Suno AI 遭指控抓取 YouTube 數據用於模型訓練
一起涉及 Suno 內部系統的安全漏洞顯示,該公司可能抓取了數十年的 YouTube 音訊數據來訓練其音樂生成模型。此揭露凸顯了生成式 AI 在數據來源實踐上日益嚴峻的爭議。
Tag: #data-scraping11 results

一起涉及 Suno 內部系統的安全漏洞顯示,該公司可能抓取了數十年的 YouTube 音訊數據來訓練其音樂生成模型。此揭露凸顯了生成式 AI 在數據來源實踐上日益嚴峻的爭議。

Suno 確認在 11 月發生安全漏洞,駭客存取了其原始碼。據報導,洩漏的資料包含該公司如何抓取數百萬首歌曲以進行模型訓練的詳細資訊。

Anthropic 正式指控 Alibaba 透過發送數百萬次查詢,利用其 Claude 模型來訓練競爭對手 AI。此爭議凸顯了 AI 產業中關於模型蒸餾與數據抓取行為日益激烈的緊張局勢。

紐約時報、CNN、今日美國與衛報等主要新聞出版商正封鎖 Internet Archive 的 Wayback Machine 爬蟲。橫跨九國的 241 家以上組織意在阻止 AI 公司用歸檔網頁數據訓練模型。檔案館館長稱這是 AI 數據戰中的附帶損害。

Scale AI 由 Meta 持有 49% 股權,透過 Outlier 平台僱用數萬名兼職人員,從 Instagram 個人帳戶、版權作品及色情內容標記資料,用於 AI 訓練。這些工作者包括醫學、物理及經濟專家,描述任務的絕望性質。此揭露 AI 開發中的爭議性資料來源作法。
作為打擊代理伺服器網路行動的一部分,FBI 已接管了屬於 Alarum Technologies Ltd 的網站。

代理伺服器對於抓取訓練 AI 模型的數據至關重要,但正面臨越來越多的審查。本文探討了在大規模數據收集過程中保持來源倫理的挑戰。

LinkedIn 掃描用戶瀏覽器擴充功能引發爭議,並導致兩起訴訟。公司聲稱這些指控是由於擴充開發者因刮取資料而被停用所捏造。

AI龐大的資料需求正助長一個陰影代理網路生態系。使用者常不知情同意「頻寬分享」,讓其網路連線被用於資料抓取。這引發AI訓練中的隱私與倫理疑慮。

Wired 調查了 DeleteMe 的有效性,這是一項旨在從數據經紀人網站中刪除個人資料的服務。該評論探討了在自動化數據抓取時代,此類服務是否能真正減輕垃圾郵件和隱私風險。