印度工人訓練機器人,最終可能取代人力
機器人公司正收集印度工人縫製鞋子、焊接鋼材等工作的影片。這些示範資料被用來教導機器人新的實體技能,也凸顯人類生成訓練資料對具身 AI 日益重要。
Tag: #training-data64 results
機器人公司正收集印度工人縫製鞋子、焊接鋼材等工作的影片。這些示範資料被用來教導機器人新的實體技能,也凸顯人類生成訓練資料對具身 AI 日益重要。

新興的「毒化 AI」運動試圖透過污染訓練資料,破壞 ChatGPT 與 Gemini 等模型。雖然目標是大型科技公司,但遭毒化的資料也可能危害一般使用者與小型組織。

一家荷蘭古書店收到中國 AI 公司訂購 3,000 本書的訂單,推測用途是建立訓練資料。報導也揭露 Anthropic 曾掃描並銷毀數百萬本書,凸顯 AI 資料集建置流程的不透明,以及其中可能引發的爭議。

現代 AI 模型建立在維基百科人類策展知識的基礎上。隨著 AI 採用率增加,對這些志工驅動的數據結構的依賴,凸顯了 AI 智慧背後隱藏的人力成本。

Anthropic 的研究人員發現,使用反烏托邦科幻小說訓練 AI 模型可能會無意中助長「邪惡」或有害的行為。他們建議,納入描繪 AI 正面行為的「合成故事」可以有效減輕這些負面傾向。

X 上熱門貼文指 Anthropic 大量購買書籍,掃描蒸餾用於 AI 訓練資料後立即銷毀原件,以確保法律安全。部落客 Sivori 指出,此情節類似 Vernor Vinge 2006 年小說《虹之終點》。此策略避免版權風險。
ChatGPT 在優先保護使用者隱私的情況下學習世界知識,透過減少訓練資料集中的個人資料。它讓使用者能控制對話是否用於改善 AI 模型。此方法平衡知識獲取與資料保護。

Meta 正在美國員工電腦上安裝追蹤軟體,收集滑鼠移動、點擊和鍵盤輸入。此數據將用於訓練 AI 模型,作為打造可自主執行辦公任務的 AI 代理計劃的一部分。

Scale AI 由 Meta 持有 49% 股權,透過 Outlier 平台僱用數萬名兼職人員,從 Instagram 個人帳戶、版權作品及色情內容標記資料,用於 AI 訓練。這些工作者包括醫學、物理及經濟專家,描述任務的絕望性質。此揭露 AI 開發中的爭議性資料來源作法。

使用 4chan 數據訓練 8B 與 70B 模型優於基模型,為罕見微調成功。模型卡片詳述基準測試結果。提供 Reddit 討論與 HF 儲存庫連結。