🌐較早收集於 40m

錄製家務影片以訓練人形機器人

錄製家務影片以訓練人形機器人
PostLinkedIn
🌐閱讀原文: Wired

💡了解人形機器人面臨的數據瓶頸,以及以人為本的數據收集所帶來的倫理風險。

⚡ 30-Second TL;DR

有什麼變化

家務任務正被商品化為具身智慧(Embodied AI)的訓練數據。

為什麼重要

隨著具身智慧的擴展,對高品質、多樣化人類演示數據的需求將推動新的數據收集市場。從業者必須處理從私人環境獲取數據的倫理複雜性。

下一步行動

評估您的具身智慧數據管道;考慮在訓練數據集中實施隱私保護技術,例如模糊處理人臉或敏感物體。

誰應關注:Researchers & Academics

關鍵要點

  • 家務任務正被商品化為具身智慧(Embodied AI)的訓練數據。
  • 人類參與的數據收集對於訓練機器人適應家庭環境至關重要。
  • 在錄製個人生活空間進行 AI 訓練時,會引發隱私與倫理疑慮。

🧠 深度解析

Web-grounded analysis with 23 cited sources.

🔑 增強重點摘要

  • 具身智慧機器人的訓練正透過大規模的人類真實場景數據採集進行,例如京東啟動了「人類歷史上規模最大的數據採集行動」,目標在兩年內收集超過1000萬小時的影片數據,並使用頭戴式JoyEgoCam設備精確捕捉肢體軌跡和力度分佈等關鍵參數。
  • 機器人主要透過「模仿學習」從人類示範中習得技能,數據採集員常佩戴VR設備在模擬家庭環境中遠程示範動作,單一小動作可能需重複約200次,且不僅限於視覺數據,還包括透過專業設備捕捉的觸覺資訊。
  • 儘管在受控模擬環境中人形機器人的任務成功率顯著提升(2026年達89.4%),但在真實、不可預測的家庭環境中執行家務任務的成功率仍僅約12%,高達88%的任務會失敗,顯示「具身鴻溝」是其落地應用的主要瓶頸。
  • 為應對具身智能帶來的隱私與倫理挑戰,業界正積極探討相關規範,例如中國已發布人形機器人數據集標準以確保數據互通性與質量,同時也強調需建立數據安全認證和個人信息保護影響評估機制,以防範機器人作為「移動數據收集站」可能造成的隱私侵犯和潛在情感依賴。
  • 開源社群和數據共享平台在加速具身智能發展中扮演關鍵角色,例如Hugging Face的LeRobot工具包旨在降低數據採集成本,而上海智元新創技術有限公司也開源了AgiBot World百萬級真機數據集,以促進全球開發者在真實數據基礎上的算法創新。
📊 競品分析▸ Show
 公司/項目  主要特點  價格/成本  訓練方式  合作夥伴 
Figure 01 類人外形設計,能執行清潔、烹飪、整理等複雜家務,具備基本互動與溝通能力。 未公開,但同類產品如1X Neo約2萬美元,AiMoga M1超過4萬美元。 透過觀看人類示範學習(如10小時學會咖啡製作),整合OpenAI模型提供高階視覺與語言智能。 OpenAI (提供GPT模型)、Microsoft、NVIDIA、Jeff Bezos等。
Google DeepMind Mobile ALOHA 雙手操作(bimanual),能烹飪、清潔、洗碗、疊衣、除塵,靈活穿梭狹窄空間。 現有成本約3萬美元,目標降至數千美元。 監督式行為克隆(supervised behavior cloning),從人類示範數據中學習,並與現有靜態ALOHA數據集共同訓練。 史丹佛大學。
智元 (Zhipu AI) 人形機器人 AgiBot World數據集包含80多種工作技能(如打飯、熨燙、洗刷馬桶、搬運、掃碼),具備360度感知能力。 預計5年內進入家庭,價格降至10萬人民幣以內。 在數據採集工廠中,數據採集師手持手柄遠程示範動作,機器人跟隨學習,數據經嚴格篩選。 上海人工智能實驗室、國家地方共建人形機器人創新中心、上海庫帕思科技公司。
Eka 專注於機器人動作靈活度,透過AI模型「自主學習」抓握、移動物體,展現超人類靈活度潛力。 未公開。 AI模型自主學習,而非單純模仿人類提供的訓練資料。 麻省理工學院教授Pulkit Agrawal、Google DeepMind前研究員Tuomas Haarnoja。
京東 (JD.com) 建設全球最大具身智能數據採集中心,目標兩年內收集超1000萬小時人類真實場景影片數據。 未公開。 透過頭戴式JoyEgoCam採集終端,在日常家務中獲取上肢軌跡、力度分佈、人與環境交互關係等數據。 宿遷市聯合打造數據採集社區。

🛠️ 技術深入

  • 學習方法:主要採用模仿學習(Imitation Learning),機器人透過觀察人類示範來學習任務。例如,Mobile ALOHA使用監督式行為克隆(supervised behavior cloning)從人類示範數據中學習。 也有研究探索元學習(meta-learning)方法,如史丹佛大學的「神經任務程式設計」(Neural Task Programming, NTP),讓機器人從少量範例中快速學習新技能。
  • 數據類型與採集:具身智能系統需要多模態數據,包括視覺(2D圖像、3D點雲、影片)、聽覺(音頻波形、頻譜圖)、觸覺(振動及壓力信號)、嗅覺、味覺、運動學狀態(位置、姿態、速度)和動力學狀態(力矩、加速度)等。 數據採集可透過頭戴式設備(如京東的JoyEgoCam)捕捉第一人稱視角數據,或透過VR設備進行遠程示範。
  • 模型架構:大型語言模型(LLMs)被整合到機器人系統中,為機器人提供高階的視覺和語言理解能力,例如Figure 01整合了OpenAI的GPT模型。 Transformer架構也被應用於機器人學習模型,如Google DeepMind的RTX模型,能從多種機器人經驗中學習並提高適應性。 「世界模型」(World Models)是當前AI發展的關鍵方向,旨在讓機器人理解物理規律、感知現實世界並進行推論預測。
  • 傳感器與硬體:機器人配備多種傳感器以感知環境,包括環繞式攝像頭(如智元機器人的8個攝像頭提供360度感知)、麥克風、光達(LiDAR)用於深度感知、力矩傳感器和觸覺傳感器。 其中,觸覺傳感器被認為是提升機器人靈巧操作能力的關鍵瓶頸,但智元機器人已配備六維力傳感器和高精度觸覺傳感器。 執行器系統(Actuation System)由馬達、減速器或齒輪組等組成,負責將電能轉換為精確運動。
  • 訓練環境:除了真實世界的數據採集工廠(如智元在上海浦東的3000平方米訓練基地)和社區(如京東在宿遷的數據採集社區),高度擬真的虛擬模擬環境也被用於大量、快速且安全的訓練。
  • 挑戰:具身智能發展面臨的關鍵瓶頸之一是高質量實操數據的規模化擴展,行業估計需要數千萬小時的真實場景數據,而目前全球僅有數十萬小時的有效供給。 此外,模擬環境中的高成功率與真實世界中的低成功率之間存在顯著的「具身鴻溝」。

🔮 前景展望AI analysis grounded in cited sources

人形機器人將在未來5年內逐步進入家庭,並在2-3年內普及於製造業和物流業。
智元等公司預測人形機器人將在2-3年內在製造業領域普及,並在5年左右進入家庭,價格有望降至10萬人民幣以內。
「世界模型」的發展將大幅提升機器人的自主性和對物理世界的理解能力。
NVIDIA和Google等科技巨頭正聚焦於「世界模型」的研發,這將使未來的AI機器人能夠理解物理規律、感知現實世界並進行推論預測,而非僅是執行指令。
具身智能的倫理和法律框架,特別是關於隱私和情感互動的規範,將變得日益重要且正式化。
隨著機器人更深入地融入日常生活並展現類人互動,其作為「移動數據收集站」的潛在隱私侵犯、數據安全問題以及可能產生的人類情感依賴,將促使更完善的倫理準則和法律法規的制定。

時間線

2013
加州大學柏克萊分校Pieter Abbeel教授團隊展示機器人透過觀看人類示範學習打結,無需程式指令。
2018-04
史丹佛大學研究員Animesh Garg分享機器人透過「神經任務程式設計」(NTP)從烹飪影片學習,實現通用型機器人夢想。
2023-10
Google DeepMind與33個學術實驗室合作開發Open X-Embodiment數據集和RTX模型,旨在訓練機器人處理更廣泛任務。
2024-03
Figure AI宣布與OpenAI合作,將GPT模型整合至Figure 01,使其具備高階視覺與語言智能,並展示透過觀看人類操作學習咖啡製作。
2025-01
上海智元新創技術有限公司聯合發布AgiBot World百萬級真機數據集,包含80多種家務技能,加速具身智能算法創新。
2026-05
京東在宿遷啟動全國首個具身智能數據採集社區,目標兩年內收集超過1000萬小時的人類真實場景影片數據。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Wired