⚛️量子位•較早收集於 47m
復旦系團隊發布機器人原生世界動作模型

💡來自高成長團隊的具身智慧新架構,機器人世界模型領域的潛在突破。
⚡ 30-Second TL;DR
有什麼變化
引入創新的機器人時空一體化架構
為什麼重要
該模型透過統一空間與時間數據處理,有望顯著提升具身智慧體感知與互動物理環境的能力。
下一步行動
密切關注該項目的 GitHub 或研究論文,以獲取其時空架構的基準測試數據。
誰應關注:Researchers & Academics
關鍵要點
- •引入創新的機器人時空一體化架構
- •由具有復旦大學背景的團隊開發
- •半年內完成五輪融資,展現強勁市場信心
🧠 深度解析
Web-grounded analysis with 11 cited sources.
🔑 增強重點摘要
- •該模型由復旦大學深度學習實驗室的核心團隊開發,並由復旦大學未來信息創新學院教授陳濤、前英特爾中國首席科學家張益民博士及前英偉達技術負責人共同組成「復旦鐵三角」核心陣容,具備深厚的學術與工程背景。
- •眸深智能推出的STI-WM模型,旨在解決現有視覺語言動作模型(VLA)、通用世界模型及影片推演方案在空間感知精度、物理邏輯約束、長時序規劃及真機落地魯棒性方面的痛點,為物理世界AGI落地提供優化路徑。
- •該團隊在推出STI-WM之前,已在具身智能領域取得多項國際頂尖榮譽,包括ICCV 2023全球三維目標識別冠軍、CVPR 2024三維密集語義推理冠軍,並斬獲IJCAI 2025傑出論文獎,同時發布了全球首個人形動作生成大模型MotionGPT和三維世界模型HL3DWM。
- •STI-WM模型能夠兼容RGB圖像、深度點雲及機器人本體等多模態感知輸入,將複雜環境信息統一編碼為緊湊高效的時空潛在世界狀態,支援百秒級長時程任務推演與全局軌跡規劃,並輸出精準的精細化動作片段。
- •該模型透過實時環境觀測動態糾偏與在線重規劃,構建了「理解世界—推演未來—規劃動作—執行糾錯」的完整物理智能閉環,顯著提升機器人在真實物理世界中的自主感知、推理、決策與穩定交互能力。
📊 競品分析▸ Show
機器人世界動作模型/基礎模型競爭分析
| 特性/公司 | 眸深智能 (STI-WM) | NVIDIA (Isaac GR00T / DreamDojo) | Google (RT系列 / Gemini Robotics / SIMA) | Tesla (Optimus / FSD AI) |
|---|---|---|---|---|
| 核心理念 | 時空一體化建模、物理一致性約束、端到端原生融合,專為機器人原生打造的通用具身大腦。 | 開放基礎模型,使機器人能從模仿、強化學習和影音數據中學習,構建機器人界的安卓系統。 | 通用策略學習,透過大規模數據和強化學習,實現機器人泛化與自監督學習。 | 將智能汽車FSD算法、數據和算力優勢移植到人形機器人,強調真實數據閉環。 |
| 技術架構 | 兼容多模態感知輸入(RGB、點雲、本體數據),統一編碼為時空潛在世界狀態,支援長時程任務推演與精細動作輸出,具備「理解-推演-規劃-糾錯」閉環。 | 透過Omniverse合成數據引擎、Isaac Sim模擬訓練,利用Cosmos世界模型和GR00T開放模型,強調物理AI基礎設施。DreamDojo利用大規模人類視頻預訓練,實現可控「想像力」。 | RT系列模型(RT-1、RT-2)專注於通用策略,SIMA透過遊戲環境進行訓練,學習真實世界行動。 | 數十億英里FSD真實道路數據、自研AI芯片(AI5)、超算(Dojo 3)及軟件棧協同,實現算法遷移。 |
| 數據來源 | 未明確具體數據集,但強調時空一體化建模與物理一致性約束。 | Isaac Sim合成數據、Cosmos生成視頻數據、Newton物理引擎仿真、DreamDojo使用44,000小時第一人稱人類視頻。 | Open X-Embodiment數據集、Google內部大規模機器人數據、遊戲環境數據。 | 超過600萬輛特斯拉車輛每天產生1600億幀真實世界視頻數據。 |
| 應用場景 | 全面賦能人形機器人、四足機器人、工業機械臂、服務機器人等全品類硬體,加速通用具身智能規模化落地。 | 透過開放生態系統,支援多種人形機器人(Figure AI, Apptronik, Sanctuary AI, Agility Robotics, 1X Technologies)及工業應用。 | 具身智能通用策略,從虛擬到現實的遷移學習,提升機器人泛化能力。 | 人形機器人Optimus,旨在工廠、家庭等通用勞動場景。 |
| 市場策略 | 專注於底層技術突破與產業商業化,半年內完成五輪融資,展現強勁市場信心。 | 構建機器人AI的「操作系統級」基礎設施,透過開放模型和生態系統吸引開發者。 | 透過學術合作與內部研發,推動機器人學習與強化學習前沿。 | 垂直整合,從硬件到AI芯片、軟件棧、數據閉環,打造自家機器人生態。 |
| 基準/性能 | 支援百秒級長時程任務推演與全局軌跡規劃,輸出精準精細化動作片段。 | Isaac Sim平台在GPU加速模擬中以1000倍實時速度訓練機器人。DreamDojo在單張H100 GPU上實現10.81 FPS實時推理速度。 | RT-2等模型在多任務泛化能力上表現突出,但具體基準未詳述。 | Optimus V3強調AI大腦、世界模型、VLA模型、端側推理、真實數據閉環。 |
| 定價 | 未公開 | 未公開,但其生態工具和硬件有相關成本。 | 未公開 | 未公開,但Optimus目標成本為2萬-5萬美元。 |
🛠️ 技術深入
- 模型名稱: STI-WM (Spatiotemporally Integrated World Model)
- 核心理念: 以時空一體化建模、物理一致性約束、端到端原生融合為核心,旨在打破傳統模型技術桎梏,開闢物理世界AGI落地的最優技術路徑。
- 輸入模態: 可兼容RGB圖像、深度點雲、機器人本體等多模態感知輸入。
- 世界狀態編碼: 將複雜環境信息統一編碼為緊湊高效的時空潛在世界狀態。
- 上層能力: 支援百秒級長時程任務推演與全局軌跡規劃。
- 下層輸出: 輸出精準可控的精細化動作片段。
- 物理智能閉環: 依托實時環境觀測動態糾偏、在線重規劃,構建出「理解世界—推演未來—規劃動作—執行糾錯」的完整物理智能閉環。
- 解決痛點: 旨在解決當前主流VLA視覺語言動作模型、通用世界模型、視頻推演方案普遍存在的空間感知精度不足、物理邏輯約束缺失、長時序規劃能力薄弱、真機落地魯棒性差等問題。
- 學術積澱: 團隊長期深耕世界模型、三維感知、時序動作生成三大底層核心技術。
- 已發布模型: 曾推出全球首個人形動作生成大模型MotionGPT、三維世界模型HL3DWM。
🔮 前景展望AI analysis grounded in cited sources
該模型將加速通用具身智能在多種機器人硬體上的規模化落地。
STI-WM的時空一體化架構和對多模態輸入的兼容性,使其能夠適應人形機器人、四足機器人、工業機械臂和服務機器人等不同硬體平台。
中國在物理AI技術領域有望領跑全球,開啟物理世界AGI新紀元。
眸深智能團隊的技術突破和多項國際頂級榮譽,結合其「理解-推演-規劃-糾錯」的完整閉環,為中國原生物理AI技術的發展奠定了堅實基礎。
機器人開發將從傳統的「編程驅動」轉向「訓練驅動」,大幅降低開發成本和周期。
物理AI的發展趨勢是讓機器人在虛擬環境中透過海量訓練自主學習,再將能力遷移到現實世界,這與STI-WM的閉環學習和推演能力相契合。
⏳ 時間線
2021
眸深智能核心團隊前瞻性佈局世界模型、三維感知、時序動作生成三大底層核心技術。
2023-10
團隊斬獲ICCV 2023全球三維目標識別冠軍。
2024-06
團隊斬獲CVPR 2024三維密集語義推理冠軍。
2025
團隊推出全球首個人形動作生成大模型MotionGPT及三維世界模型HL3DWM。
2025
團隊斬獲IJCAI 2025傑出論文獎。
2026-05
眸深智能正式推出STI-WM時空一體世界動作模型,並在半年內完成五輪融資。
📎 來源 (11)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗
