🏠較早收集於 6h

Meta 利用員工工作數據訓練內部 AI 模型

Meta 利用員工工作數據訓練內部 AI 模型
PostLinkedIn
🏠閱讀原文: IT之家

💡了解 Meta 如何優先使用內部專家數據而非外包,以在 AI 模型訓練中取得競爭優勢。

⚡ 30-Second TL;DR

有什麼變化

Meta 正在利用內部員工的工作數據來訓練 AI 模型。

為什麼重要

這凸顯了利用專有內部數據與「人在迴路」(human-in-the-loop) 工作流程來構建專業化、高效能模型的趨勢。

下一步行動

評估您的內部數據集,並考慮實施「專家在迴路」(expert-in-the-loop) 的數據收集機制,以提升模型的領域特定推理能力。

誰應關注:Developers & AI Engineers

關鍵要點

  • Meta 正在利用內部員工的工作數據來訓練 AI 模型。
  • Zuckerberg 聲稱內部員工提供的訓練數據品質高於外包人員。
  • 此策略旨在加速提升 AI 在程式設計與任務執行方面的能力。

🧠 深度解析

Web-grounded analysis with 20 cited sources.

🔑 增強重點摘要

  • Meta 的「模型能力倡議 (Model Capability Initiative, MCI)」涉及在美國和英國員工的設備上部署內部追蹤軟體,以捕捉詳細的行為數據,包括滑鼠移動、點擊、鍵盤輸入和定期螢幕截圖。
  • 這些收集到的數據旨在訓練 AI 代理,使其能理解人類如何與軟體互動並執行日常電腦任務,目標是創建能夠複製或協助這些任務的系統。
  • 此舉引發了員工對隱私的嚴重擔憂,內部出現反彈和反對追蹤工具的請願,且員工無法選擇退出公司配發設備上的此類追蹤。
  • 該倡議與 Meta 更廣泛的重組計畫同時進行,包括裁員數千名員工並將其他員工重新分配到 AI 相關職位,這引發了人們對由員工數據訓練的 AI 代理最終可能取代人類工作的猜測。
  • Meta 內部目標是讓 65% 的工程師使用 AI 工具編寫超過 75% 的程式碼,這表明公司正大幅轉向 AI 輔助或自動化的軟體開發。

🛠️ 技術深入

  • Meta 的「模型能力倡議 (MCI)」透過追蹤鍵盤輸入、滑鼠移動、點擊和螢幕截圖來收集數據,旨在讓 AI 模型學習人類如何實際使用電腦。
  • Meta 已開發出 Code Llama 系列模型(於 2023 年 8 月發布,Code Llama 70B 於 2024 年 1 月發布),這是一個專門用於程式碼生成、補全和偵錯的大型語言模型,支援 Python、C++、Java、PHP、Typescript (Javascript)、C# 和 Bash 等多種程式語言。
  • 於 2025 年 9 月發布的 Code World Model (CWM) 是一個擁有 320 億參數的開源大型語言模型 (LLM),其訓練數據包括 1.2 億條 Python 執行軌跡和 300 萬條代理軌跡,旨在理解程式碼的執行語義而非僅僅語法。CWM 是一個密集型、僅解碼器 (decoder-only) 的 LLM,上下文大小可達 131k 個 token。
  • CWM 的目標是實現 Python 程式碼執行的逐步模擬,並透過在計算環境中的推理和規劃來改進代理編碼。
  • Meta 的 AI 策略核心是龐大的計算能力、開源模型發布(如 Llama 系列)以及獲取高品質訓練數據。
  • 公司還開發了多模態 AI 系統,例如 Muse Spark,它結合了文本、視覺理解和工具使用,用於高級推理和多代理協調。
  • Meta 使用「AI 利用率指標」框架來量化員工 AI 生產力提升,追蹤工具參與率、生產力放大因子、任務轉移指數、品質一致性分數、採用保留指標和協同分數。

🔮 前景展望AI analysis grounded in cited sources

企業對員工的監控將成為 AI 訓練數據收集的新常態。
Meta 的「模型能力倡議」透過追蹤鍵盤輸入、滑鼠移動和螢幕截圖來收集數據,這可能促使其他公司效仿以獲取高質量行為數據。
AI 代理將在軟體開發和日常任務中取代部分人類工作。
Meta 旨在讓 65% 的工程師使用 AI 工具完成超過 75% 的程式碼編寫,並在實施員工數據追蹤的同時進行裁員,暗示了自動化對勞動力的影響。
員工隱私權和數據使用倫理將面臨更嚴峻的法律和社會挑戰。
Meta 的做法引發了員工的強烈反彈和隱私擔憂,現有法律在 AI 時代對員工保護不足,可能導致未來更嚴格的法規和訴訟。

時間線

2013
Meta AI (原 Facebook Artificial Intelligence Research, FAIR) 成立。
2017
FAIR 發布 PyTorch,一個開源機器學習框架。
2023-02
LLaMA 1 發布,挑戰閉源模型範式。
2023-08
Code Llama 發布,一個用於程式碼生成的大型語言模型。
2025-09
Code World Model (CWM) 發布,一個 320 億參數的開源 LLM,旨在提升程式碼理解和代理編碼能力。
2026-04
Meta 啟動「模型能力倡議 (MCI)」,開始追蹤美國員工的鍵盤輸入、滑鼠移動和螢幕截圖以訓練 AI 模型。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家