⚛️最新收集於 35m

三家中國公司衝刺百萬小時具身資料

三家中國公司衝刺百萬小時具身資料
PostLinkedIn
⚛️閱讀原文: 量子位

💡百萬小時資料計畫,可能重塑具身 AI 訓練的規模與成本結構。

⚡ 30-Second TL;DR

有什麼變化

三家公司將目標設定為一百萬小時的具身 AI 資料。

為什麼重要

大型且整合的具身資料集,可能加速機器人策略訓練,並減少資料供應商與模型開發者之間的割裂。其實際價值將取決於資料多樣性、品質、授權,以及仿真到真實機器人的遷移效果。

下一步行動

在將新的具身資料加入訓練流程前,先定義統一的機器人軌跡、仿真中繼資料與評測任務格式。

誰應關注:Developers & AI Engineers

關鍵要點

  • 三家公司將目標設定為一百萬小時的具身 AI 資料。
  • 合作涵蓋實體資料採集與仿真環節。
  • 訓練與評測也納入其中,以建立端到端資料閉環。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 此項合作旨在解決具身智慧(Embodied AI)領域長期面臨的『資料荒』問題,特別是高品質、多樣化實體機器人操作數據的匱乏。
  • 參與企業計畫採用『虛實結合』策略,利用大規模仿真環境(Sim-to-Real)生成合成數據,以彌補實體採集成本過高的缺口。
  • 該計畫不僅關注數據量,還強調數據的『語義標註』與『行為序列對齊』,以提升機器人對複雜指令的理解與執行能力。
  • 合作框架中包含統一的數據標準化協議,旨在打破不同機器人硬體平台間的數據壁壘,實現跨平台模型遷移。
  • 此舉被視為中國具身智慧產業鏈的整合嘗試,試圖通過共享數據基礎設施,縮短與國際領先機器人模型(如 Google RT-2 或 Tesla Optimus 相關數據集)的技術差距。
📊 競品分析▸ Show
比較項目本次合作聯盟Tesla (Optimus)Google DeepMind (RT-X)
資料來源多家企業聯合採集與仿真自有工廠與實體部署學術合作與開源數據集
核心優勢產業鏈整合與數據規模化硬體量產能力與真實場景數據演算法領先與跨平台泛化能力
數據規模目標 100 萬小時未公開(持續累積中)數十萬小時(多機器人協作)

🛠️ 技術深入

  • 採用多模態大模型(VLA, Vision-Language-Action)架構,將視覺輸入、語言指令與機器人動作序列進行端到端映射。
  • 引入基於擴散模型(Diffusion Policy)的動作生成技術,提升機器人在非結構化環境下的決策穩定性。
  • 實施大規模並行仿真訓練,利用 GPU 集群進行物理引擎加速,實現每日數萬小時的合成數據生成效率。
  • 建立自動化數據清洗與品質評估流水線,利用 AI 模型自動過濾低品質或冗餘的動作軌跡數據。

🔮 前景展望AI analysis grounded in cited sources

具身智慧模型訓練成本將顯著下降
通過標準化數據集與共享仿真基礎設施,企業可大幅降低單一公司獨立開發所需的數據採集與算力成本。
中國機器人產業將出現統一的軟體中介軟體標準
為實現百萬小時數據的跨平台訓練,參與企業必須推動底層數據格式與硬體介面的統一,進而影響行業標準。

時間線

2025-06
三家公司啟動具身智慧數據聯合採集計畫初步意向
2026-01
完成首批 10 萬小時仿真數據集驗證與模型初步訓練
2026-05
正式對外宣布衝刺百萬小時具身數據集目標
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位