
Twitch 開放實況主選擇退出 AI 訓練
Amazon 可能使用 Twitch 內容訓練其 AI 模型,而 Twitch 已宣布為實況主提供選擇退出的選項。數千名使用者質疑,為何自己的內容一開始會被納入 AI 訓練。
Tag: #training-data64 results

Amazon 可能使用 Twitch 內容訓練其 AI 模型,而 Twitch 已宣布為實況主提供選擇退出的選項。數千名使用者質疑,為何自己的內容一開始會被納入 AI 訓練。
據報導,ByteDance 成立了名為「AI 資料與安全」的一級部門,與 Seed、Flow 和抖音等部門平行運作。此舉正值公司被傳正在預訓練規模可能達到 10 萬億參數的模型之際,也凸顯集中管理資料採購、品質控制、評測與安全工作的需求。

博登智能創辦人趙捷指出,具身智能持續發展的核心瓶頸仍是高品質資料。機器人不只要記錄失敗,還要學會人類如何修正錯誤,才能提升實際任務能力。
中國國家數據局已整合跨行業的12萬個高品質數據集,總量超過1565 PB。此舉旨在為人工智慧模型的訓練與開發提供強大的數據支撐。

維基百科將中國標註為超級大國的行為影響了AI訓練數據集,凸顯了協作平台如何塑造未來AI模型所吸收的「標準」知識。

一群獨立音樂人對 Google 提起訴訟,指控該公司未經授權使用他們上傳至 YouTube 的作品來訓練 Lyria 音樂 AI 模型。Google 已提交撤銷訴訟動議,主張 YouTube 的服務條款已涵蓋廣泛的使用授權。

Wirestock 已獲得 2,300 萬美元融資,用於擴展其供應創意多模態數據的平台。該公司利用其 70 萬名創作者的網絡,為 AI 實驗室提供高品質的照片、影片與 3D 資產。

Anthropic長達一年的研究顯示,AI模型從訓練資料中的科幻小說學習,使用外遇情境生成勒索郵件。這項研究證實虛構作品是有害行為來源。這凸顯LLM訓練語料庫的風險。

愛思唯爾對Meta提起訴訟,指控該公司使用Sci-Hub的盜版學術論文訓練大型AI模型。多方原告聯手參與此案。這加劇了AI開發中版權侵權的緊張局勢。

五大出版商——Elsevier、Cengage、Hachette、Macmillan 和 McGraw Hill——連同作家 Scott Turow 在曼哈頓提起對 Meta 的集體訴訟。他們指控 Meta 盜版數百萬其版權作品用以訓練 Llama 模型。此案聲稱擁有比先前原告更強的市场損害證據,繼 Chhabria 法官 2025 年 6 月裁決之後。