⚛️量子位•最新收集於 35m
三家中國公司衝刺百萬小時具身資料

💡百萬小時資料計畫,可能重塑具身 AI 訓練的規模與成本結構。
⚡ 30-Second TL;DR
有什麼變化
三家公司將目標設定為一百萬小時的具身 AI 資料。
為什麼重要
大型且整合的具身資料集,可能加速機器人策略訓練,並減少資料供應商與模型開發者之間的割裂。其實際價值將取決於資料多樣性、品質、授權,以及仿真到真實機器人的遷移效果。
下一步行動
在將新的具身資料加入訓練流程前,先定義統一的機器人軌跡、仿真中繼資料與評測任務格式。
誰應關注:Developers & AI Engineers
關鍵要點
- •三家公司將目標設定為一百萬小時的具身 AI 資料。
- •合作涵蓋實體資料採集與仿真環節。
- •訓練與評測也納入其中,以建立端到端資料閉環。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •此項合作旨在解決具身智慧(Embodied AI)領域長期面臨的『資料荒』問題,特別是高品質、多樣化實體機器人操作數據的匱乏。
- •參與企業計畫採用『虛實結合』策略,利用大規模仿真環境(Sim-to-Real)生成合成數據,以彌補實體採集成本過高的缺口。
- •該計畫不僅關注數據量,還強調數據的『語義標註』與『行為序列對齊』,以提升機器人對複雜指令的理解與執行能力。
- •合作框架中包含統一的數據標準化協議,旨在打破不同機器人硬體平台間的數據壁壘,實現跨平台模型遷移。
- •此舉被視為中國具身智慧產業鏈的整合嘗試,試圖通過共享數據基礎設施,縮短與國際領先機器人模型(如 Google RT-2 或 Tesla Optimus 相關數據集)的技術差距。
📊 競品分析▸ Show
| 比較項目 | 本次合作聯盟 | Tesla (Optimus) | Google DeepMind (RT-X) |
|---|---|---|---|
| 資料來源 | 多家企業聯合採集與仿真 | 自有工廠與實體部署 | 學術合作與開源數據集 |
| 核心優勢 | 產業鏈整合與數據規模化 | 硬體量產能力與真實場景數據 | 演算法領先與跨平台泛化能力 |
| 數據規模 | 目標 100 萬小時 | 未公開(持續累積中) | 數十萬小時(多機器人協作) |
🛠️ 技術深入
- 採用多模態大模型(VLA, Vision-Language-Action)架構,將視覺輸入、語言指令與機器人動作序列進行端到端映射。
- 引入基於擴散模型(Diffusion Policy)的動作生成技術,提升機器人在非結構化環境下的決策穩定性。
- 實施大規模並行仿真訓練,利用 GPU 集群進行物理引擎加速,實現每日數萬小時的合成數據生成效率。
- 建立自動化數據清洗與品質評估流水線,利用 AI 模型自動過濾低品質或冗餘的動作軌跡數據。
🔮 前景展望AI analysis grounded in cited sources
具身智慧模型訓練成本將顯著下降
通過標準化數據集與共享仿真基礎設施,企業可大幅降低單一公司獨立開發所需的數據採集與算力成本。
中國機器人產業將出現統一的軟體中介軟體標準
為實現百萬小時數據的跨平台訓練,參與企業必須推動底層數據格式與硬體介面的統一,進而影響行業標準。
⏳ 時間線
2025-06
三家公司啟動具身智慧數據聯合採集計畫初步意向
2026-01
完成首批 10 萬小時仿真數據集驗證與模型初步訓練
2026-05
正式對外宣布衝刺百萬小時具身數據集目標
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗
