🌐Wired•較早收集於 40m
錄製家務影片以訓練人形機器人

💡了解人形機器人面臨的數據瓶頸,以及以人為本的數據收集所帶來的倫理風險。
⚡ 30-Second TL;DR
有什麼變化
家務任務正被商品化為具身智慧(Embodied AI)的訓練數據。
為什麼重要
隨著具身智慧的擴展,對高品質、多樣化人類演示數據的需求將推動新的數據收集市場。從業者必須處理從私人環境獲取數據的倫理複雜性。
下一步行動
評估您的具身智慧數據管道;考慮在訓練數據集中實施隱私保護技術,例如模糊處理人臉或敏感物體。
誰應關注:Researchers & Academics
關鍵要點
- •家務任務正被商品化為具身智慧(Embodied AI)的訓練數據。
- •人類參與的數據收集對於訓練機器人適應家庭環境至關重要。
- •在錄製個人生活空間進行 AI 訓練時,會引發隱私與倫理疑慮。
🧠 深度解析
Web-grounded analysis with 23 cited sources.
🔑 增強重點摘要
- •具身智慧機器人的訓練正透過大規模的人類真實場景數據採集進行,例如京東啟動了「人類歷史上規模最大的數據採集行動」,目標在兩年內收集超過1000萬小時的影片數據,並使用頭戴式JoyEgoCam設備精確捕捉肢體軌跡和力度分佈等關鍵參數。
- •機器人主要透過「模仿學習」從人類示範中習得技能,數據採集員常佩戴VR設備在模擬家庭環境中遠程示範動作,單一小動作可能需重複約200次,且不僅限於視覺數據,還包括透過專業設備捕捉的觸覺資訊。
- •儘管在受控模擬環境中人形機器人的任務成功率顯著提升(2026年達89.4%),但在真實、不可預測的家庭環境中執行家務任務的成功率仍僅約12%,高達88%的任務會失敗,顯示「具身鴻溝」是其落地應用的主要瓶頸。
- •為應對具身智能帶來的隱私與倫理挑戰,業界正積極探討相關規範,例如中國已發布人形機器人數據集標準以確保數據互通性與質量,同時也強調需建立數據安全認證和個人信息保護影響評估機制,以防範機器人作為「移動數據收集站」可能造成的隱私侵犯和潛在情感依賴。
- •開源社群和數據共享平台在加速具身智能發展中扮演關鍵角色,例如Hugging Face的LeRobot工具包旨在降低數據採集成本,而上海智元新創技術有限公司也開源了AgiBot World百萬級真機數據集,以促進全球開發者在真實數據基礎上的算法創新。
📊 競品分析▸ Show
| 公司/項目 | 主要特點 | 價格/成本 | 訓練方式 | 合作夥伴 |
|---|---|---|---|---|
| Figure 01 | 類人外形設計,能執行清潔、烹飪、整理等複雜家務,具備基本互動與溝通能力。 | 未公開,但同類產品如1X Neo約2萬美元,AiMoga M1超過4萬美元。 | 透過觀看人類示範學習(如10小時學會咖啡製作),整合OpenAI模型提供高階視覺與語言智能。 | OpenAI (提供GPT模型)、Microsoft、NVIDIA、Jeff Bezos等。 |
| Google DeepMind Mobile ALOHA | 雙手操作(bimanual),能烹飪、清潔、洗碗、疊衣、除塵,靈活穿梭狹窄空間。 | 現有成本約3萬美元,目標降至數千美元。 | 監督式行為克隆(supervised behavior cloning),從人類示範數據中學習,並與現有靜態ALOHA數據集共同訓練。 | 史丹佛大學。 |
| 智元 (Zhipu AI) 人形機器人 | AgiBot World數據集包含80多種工作技能(如打飯、熨燙、洗刷馬桶、搬運、掃碼),具備360度感知能力。 | 預計5年內進入家庭,價格降至10萬人民幣以內。 | 在數據採集工廠中,數據採集師手持手柄遠程示範動作,機器人跟隨學習,數據經嚴格篩選。 | 上海人工智能實驗室、國家地方共建人形機器人創新中心、上海庫帕思科技公司。 |
| Eka | 專注於機器人動作靈活度,透過AI模型「自主學習」抓握、移動物體,展現超人類靈活度潛力。 | 未公開。 | AI模型自主學習,而非單純模仿人類提供的訓練資料。 | 麻省理工學院教授Pulkit Agrawal、Google DeepMind前研究員Tuomas Haarnoja。 |
| 京東 (JD.com) | 建設全球最大具身智能數據採集中心,目標兩年內收集超1000萬小時人類真實場景影片數據。 | 未公開。 | 透過頭戴式JoyEgoCam採集終端,在日常家務中獲取上肢軌跡、力度分佈、人與環境交互關係等數據。 | 宿遷市聯合打造數據採集社區。 |
🛠️ 技術深入
- 學習方法:主要採用模仿學習(Imitation Learning),機器人透過觀察人類示範來學習任務。例如,Mobile ALOHA使用監督式行為克隆(supervised behavior cloning)從人類示範數據中學習。 也有研究探索元學習(meta-learning)方法,如史丹佛大學的「神經任務程式設計」(Neural Task Programming, NTP),讓機器人從少量範例中快速學習新技能。
- 數據類型與採集:具身智能系統需要多模態數據,包括視覺(2D圖像、3D點雲、影片)、聽覺(音頻波形、頻譜圖)、觸覺(振動及壓力信號)、嗅覺、味覺、運動學狀態(位置、姿態、速度)和動力學狀態(力矩、加速度)等。 數據採集可透過頭戴式設備(如京東的JoyEgoCam)捕捉第一人稱視角數據,或透過VR設備進行遠程示範。
- 模型架構:大型語言模型(LLMs)被整合到機器人系統中,為機器人提供高階的視覺和語言理解能力,例如Figure 01整合了OpenAI的GPT模型。 Transformer架構也被應用於機器人學習模型,如Google DeepMind的RTX模型,能從多種機器人經驗中學習並提高適應性。 「世界模型」(World Models)是當前AI發展的關鍵方向,旨在讓機器人理解物理規律、感知現實世界並進行推論預測。
- 傳感器與硬體:機器人配備多種傳感器以感知環境,包括環繞式攝像頭(如智元機器人的8個攝像頭提供360度感知)、麥克風、光達(LiDAR)用於深度感知、力矩傳感器和觸覺傳感器。 其中,觸覺傳感器被認為是提升機器人靈巧操作能力的關鍵瓶頸,但智元機器人已配備六維力傳感器和高精度觸覺傳感器。 執行器系統(Actuation System)由馬達、減速器或齒輪組等組成,負責將電能轉換為精確運動。
- 訓練環境:除了真實世界的數據採集工廠(如智元在上海浦東的3000平方米訓練基地)和社區(如京東在宿遷的數據採集社區),高度擬真的虛擬模擬環境也被用於大量、快速且安全的訓練。
- 挑戰:具身智能發展面臨的關鍵瓶頸之一是高質量實操數據的規模化擴展,行業估計需要數千萬小時的真實場景數據,而目前全球僅有數十萬小時的有效供給。 此外,模擬環境中的高成功率與真實世界中的低成功率之間存在顯著的「具身鴻溝」。
🔮 前景展望AI analysis grounded in cited sources
人形機器人將在未來5年內逐步進入家庭,並在2-3年內普及於製造業和物流業。
智元等公司預測人形機器人將在2-3年內在製造業領域普及,並在5年左右進入家庭,價格有望降至10萬人民幣以內。
「世界模型」的發展將大幅提升機器人的自主性和對物理世界的理解能力。
NVIDIA和Google等科技巨頭正聚焦於「世界模型」的研發,這將使未來的AI機器人能夠理解物理規律、感知現實世界並進行推論預測,而非僅是執行指令。
具身智能的倫理和法律框架,特別是關於隱私和情感互動的規範,將變得日益重要且正式化。
隨著機器人更深入地融入日常生活並展現類人互動,其作為「移動數據收集站」的潛在隱私侵犯、數據安全問題以及可能產生的人類情感依賴,將促使更完善的倫理準則和法律法規的制定。
⏳ 時間線
2013
加州大學柏克萊分校Pieter Abbeel教授團隊展示機器人透過觀看人類示範學習打結,無需程式指令。
2018-04
史丹佛大學研究員Animesh Garg分享機器人透過「神經任務程式設計」(NTP)從烹飪影片學習,實現通用型機器人夢想。
2023-10
Google DeepMind與33個學術實驗室合作開發Open X-Embodiment數據集和RTX模型,旨在訓練機器人處理更廣泛任務。
2024-03
Figure AI宣布與OpenAI合作,將GPT模型整合至Figure 01,使其具備高階視覺與語言智能,並展示透過觀看人類操作學習咖啡製作。
2025-01
上海智元新創技術有限公司聯合發布AgiBot World百萬級真機數據集,包含80多種家務技能,加速具身智能算法創新。
2026-05
京東在宿遷啟動全國首個具身智能數據採集社區,目標兩年內收集超過1000萬小時的人類真實場景影片數據。
📎 來源 (23)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Wired ↗



