來源較早收集於 35m

三家中國公司衝刺百萬小時具身資料

閱讀原文: 量子位
#embodied-ai#robotics-data#simulation#data-pipeline

百萬小時資料計畫,可能重塑具身 AI 訓練的規模與成本結構。

30 秒速覽

有什麼變化

三家公司將目標設定為一百萬小時的具身 AI 資料。

為什麼重要

大型且整合的具身資料集,可能加速機器人策略訓練,並減少資料供應商與模型開發者之間的割裂。其實際價值將取決於資料多樣性、品質、授權,以及仿真到真實機器人的遷移效果。

下一步行動

在將新的具身資料加入訓練流程前,先定義統一的機器人軌跡、仿真中繼資料與評測任務格式。

誰應關注:Developers & AI Engineers

關鍵要點

  • •三家公司將目標設定為一百萬小時的具身 AI 資料。
  • •合作涵蓋實體資料採集與仿真環節。
  • •訓練與評測也納入其中,以建立端到端資料閉環。

深度解析

本篇為 AI 生成分析,非原文內容。

增強重點摘要

  • •此項合作旨在解決具身智慧(Embodied AI)領域長期面臨的『資料荒』問題,特別是高品質、多樣化實體機器人操作數據的匱乏。
  • •參與企業計畫採用『虛實結合』策略,利用大規模仿真環境(Sim-to-Real)生成合成數據,以彌補實體採集成本過高的缺口。
  • •該計畫不僅關注數據量,還強調數據的『語義標註』與『行為序列對齊』,以提升機器人對複雜指令的理解與執行能力。
  • •合作框架中包含統一的數據標準化協議,旨在打破不同機器人硬體平台間的數據壁壘,實現跨平台模型遷移。
  • •此舉被視為中國具身智慧產業鏈的整合嘗試,試圖通過共享數據基礎設施,縮短與國際領先機器人模型(如 Google RT-2 或 Tesla Optimus 相關數據集)的技術差距。

競品分析

資料來源
本次合作聯盟
多家企業聯合採集與仿真
Tesla (Optimus)
自有工廠與實體部署
Google DeepMind (RT-X)
學術合作與開源數據集
核心優勢
本次合作聯盟
產業鏈整合與數據規模化
Tesla (Optimus)
硬體量產能力與真實場景數據
Google DeepMind (RT-X)
演算法領先與跨平台泛化能力
數據規模
本次合作聯盟
目標 100 萬小時
Tesla (Optimus)
未公開(持續累積中)
Google DeepMind (RT-X)
數十萬小時(多機器人協作)

技術深入

  • 採用多模態大模型(VLA, Vision-Language-Action)架構,將視覺輸入、語言指令與機器人動作序列進行端到端映射。
  • 引入基於擴散模型(Diffusion Policy)的動作生成技術,提升機器人在非結構化環境下的決策穩定性。
  • 實施大規模並行仿真訓練,利用 GPU 集群進行物理引擎加速,實現每日數萬小時的合成數據生成效率。
  • 建立自動化數據清洗與品質評估流水線,利用 AI 模型自動過濾低品質或冗餘的動作軌跡數據。

前景展望基於引用來源的 AI 分析

具身智慧模型訓練成本將顯著下降
通過標準化數據集與共享仿真基礎設施,企業可大幅降低單一公司獨立開發所需的數據採集與算力成本。
中國機器人產業將出現統一的軟體中介軟體標準
為實現百萬小時數據的跨平台訓練,參與企業必須推動底層數據格式與硬體介面的統一,進而影響行業標準。

時間線

2025-06
三家公司啟動具身智慧數據聯合採集計畫初步意向
2026-01
完成首批 10 萬小時仿真數據集驗證與模型初步訓練
2026-05
正式對外宣布衝刺百萬小時具身數據集目標

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。