⚛️較早收集於 52m

τ0-WM:最大規模開源具身世界模型發布

τ0-WM:最大規模開源具身世界模型發布
PostLinkedIn
⚛️閱讀原文: 量子位

💡獲取基於 17,800 小時真實機器人數據訓練的目前最大規模開源具身世界模型。

⚡ 30-Second TL;DR

有什麼變化

目前規模最大的開源具身世界模型

為什麼重要

此發布為從事通用機器人研究的開發者提供了高品質、大規模的具身 AI 基礎模型,顯著降低了研發門檻。

下一步行動

下載 τ0-WM 模型權重,並參考官方文檔評估其在您特定機器人操作任務上的表現。

誰應關注:Researchers & Academics

關鍵要點

  • 目前規模最大的開源具身世界模型
  • 使用 17,800 小時的真實機器人交互數據進行訓練
  • 專注於縮小模擬環境與真實物理任務之間的差距

🧠 深度解析

Web-grounded analysis with 14 cited sources.

🔑 增強重點摘要

  • τ0-WM模型參數量達到50億,其預訓練數據總規模約3萬小時,其中真實機器人遙操作數據佔1.78萬小時,是目前全球開源預訓練具身世界模型中最大的數據集之一.
  • 該模型由上海創智學院副教授、智元機器人首席科學家羅劍嵐帶隊發布,並在四個長程精細操作任務(Toolbox、School Bag、Badminton、Faucet)中,平均成功率超越了對標模型π0.5和Fast-WAM.
  • τ0-WM引入了「測試時計算」(Test-Time Computation)機制,允許機器人在實際執行前,在內部「虛擬沙盤」中並行想像多個候選動作的未來結果,進行比較和修正,實現類似人類的「慢思考」決策過程.
  • τ0-WM的核心是一個統一的「視訊動作模型」(Video Action Model, VAM),它利用共享的視訊擴散骨幹,結合多視角觀測、語言指令和機器人狀態,共同預測未來的視覺潛在空間和連續動作塊.
  • 該模型在具身視訊生成、3D感知及真機Core15 L1基準測試中均領先同類產品,尤其在抽象指令場景下表現突出.
📊 競品分析▸ Show

null

🛠️ 技術深入

  • 模型規模與數據: τ0-WM是一個50億參數的世界模型,在約3萬小時的異構數據語料庫上進行訓練,其中包括1.78萬小時的真實機器人遙操作數據、UMI風格數據和以自我為中心的人類視訊。
  • 核心架構: τ0-WM的核心是一個統一的視訊動作模型(Video Action Model, VAM)。它使用共享的視訊擴散骨幹,接收多視角觀測、語言指令和機器人狀態,共同預測未來的視覺潛在空間和連續動作塊。
  • 視訊與動作分支: 視訊分支負責捕捉時間結構化的場景動態,而動作分支則通過層層交叉注意力機制,關注中間視訊表示來預測可執行的控制.
  • 多源異構數據預訓練: 該模型能夠將來自不同來源、模態和動作空間的數據整合到同一個預訓練體系中,有效利用異構數據源的優勢。
  • 測試時計算(Test-Time Computation): 在推理時,τ0-WM能夠分配額外的計算資源進行動作選擇和優化。策略首先採樣多個動作塊,並通過「去噪一致性分數」(Re-denoising Consistency Score)進行排序。如果沒有候選動作得分理想,模型會進一步模擬候選未來,選擇最有前景的推演,並基於該未來進行第二次動作預測。
  • 多視角機器人感知: 為了實現多視角機器人感知,τ0-WM將繼承的單視角視訊塔擴展到多視角和多具身設置,增加了跨視角注意力機制、用於可學習相機身份的Camera RoPE以及幾何感知訓練遮罩.

🔮 前景展望AI analysis grounded in cited sources

具身世界模型將加速通用機器人的發展。
透過預測未來狀態和行動後果的能力,世界模型使機器人能夠進行更複雜的規劃和決策,減少對真實世界試錯的依賴,從而加速通用機器人的部署和應用.
「事件級預測」將成為具身智能的關鍵技術趨勢。
相較於傳統的逐幀預測,以「語義事件」為單位進行預測能讓機器人更有效地理解世界、組織行動並提升泛化能力,解決長時序任務中的「長時漂移」問題.
具身世界模型將推動AI從「被動反應」轉向「主動規劃」。
世界模型賦予智能體在行動前「想像」和「預演」未來情景的能力,使其能夠進行反事實推演和主動規劃,而非僅僅對環境刺激做出反應.

時間線

2018
Ha等人提出首個融合感知壓縮與動態建模的強化學習世界模型,使世界模型成為AI研究熱點.
2025-09-20
清華大學電子工程系城市科學與計算研究中心發布具身世界模型系統性綜述論文,全面梳理該領域關鍵技術.
2025-10-17
北京人形機器人創新中心開源WoW(World-Omniscient World Model)具身世界模型,並發布首個針對具身世界模型的綜合基準WoWBench.
2026-01-08
自變量機器人發布端到端具身智能基礎模型WALL-OSS,在RoboChallenge真機評測榜單上排名全球第二,並徹底開源.
2026-05-29
智元自研的世界模型Genie Envisioner-Sim 2.0(GE 2.0)在WorldArena Track1(世界模型感知與動作響應賽道)評測中登頂榜首.
2026-05-31
τ0-WM作為目前最大規模的開源具身世界模型正式發布,由上海創智學院副教授、智元機器人首席科學家羅劍嵐帶隊發布.

📎 來源 (14)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. agibot.com
  2. sina.cn
  3. prnewswire.com
  4. cnr.cn
  5. qingkeai.online
  6. 163.com
  7. qbitai.com
  8. 36kr.com
  9. volcengine.com
  10. tsinghua.edu.cn
  11. zhidx.com
  12. qbitai.com
  13. stcn.com
  14. tidenews.com.cn
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位