🟩NVIDIA Developer Blog•較早收集於 1m
機器人領域中 World-Action Models 的崛起

💡了解 NVIDIA 如何結合世界模型與行動策略,打造下一代具身智慧機器人。
⚡ 30-Second TL;DR
有什麼變化
VLA 模型透過調整預訓練的 VLM 骨幹,將視覺與語言輸入轉化為具體行動。
為什麼重要
這項研究標誌著機器人正朝向更具備通用性、能在行動前進行環境推理的方向發展。它為開發者提供了一條超越簡單模仿學習的技術路徑。
下一步行動
研究 Pi-0 與 GR00T 架構,了解如何將世界模型先驗知識整合進您自己的機器人控制迴路中。
誰應關注:Researchers & Academics
關鍵要點
- •VLA 模型透過調整預訓練的 VLM 骨幹,將視覺與語言輸入轉化為具體行動。
- •WAM 利用預訓練的世界模型或影片模型來預測未來狀態,以提升決策能力。
- •大規模預訓練被視為實現高效具身智慧(Embodied AI)策略的核心關鍵。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 22 個來源。
🔑 增強重點摘要
- •世界行動模型(WAM)透過聯合預測未來世界狀態和機器人動作,並利用影片預訓練來學習物理動態,從而實現零樣本泛化和人機轉移,這是視覺-語言-行動(VLA)模型難以實現的。
- •NVIDIA Eureka 是一個由 AI 驅動的代理,它利用大型語言模型(如 GPT-4)自主生成強化學習的獎勵演算法,顯著提高了機器人技能學習的效率,在超過 80% 的評估任務中性能提升超過 50%。
- •NVIDIA 的 Cosmos 3 是一個全模態世界模型,採用統一的 Transformer 混合架構(Mixture-of-Transformers),結合自回歸 Transformer 用於推理和擴散 Transformer 用於多模態生成,能處理並生成語言、圖像、影片、音訊和動作序列。
- •跨實體學習(cross-embodiment learning)是 VLA 研究的一大突破,透過在多種機器人硬體平台上訓練單一模型,可使該模型在每個單獨硬體上的表現優於僅針對特定機器人訓練的模型,從而加速工業自動化中的機器人重新任務化。
- •具備推理能力的 VLA 模型(Reasoning VLA)透過整合明確的 AI 推理能力,將複雜任務分解為可管理子問題,並生成可解釋的推理過程,顯著提高了自動系統在複雜環境中執行任務的準確性和安全性。
📊 競品分析▸ Show
| 公司/模型 | 類型 | 主要特點/方法 | 基準測試表現 (RoboArena/WorldArena) |
|---|---|---|---|
| NVIDIA Cosmos 3 | WAM (世界行動模型) | 全模態世界模型,統一的Transformer混合架構,用於推理和多模態生成。 | Cosmos3-Nano-Policy 在 RoboArena 排名第二 (1,881分);Cosmos-Predict 2.5 在 WorldArena 政策評估器軌道上被超越 |
| NVIDIA DreamZero | WAM (世界行動模型) | 基於預訓練影片擴散骨幹,聯合預測未來世界狀態和動作,實現零樣本泛化。 | RoboArena 排名第三 (1,763分) |
| NVIDIA Isaac GR00T N1.6 | VLA (視覺-語言-行動) | 專為人形機器人設計,雙系統架構,結合視覺與語言理解以預測動作,側重全身控制。 | - |
| Spirit AI Spirit v1.6 | 具身智慧基礎模型 | 中國新創公司,在具身智慧領域表現突出。 | RoboArena 全球排行榜第一名 (1,924分),超越 NVIDIA Cosmos3-Nano-Policy |
| Manifold AI WorldScape-0.2 | 具身世界模型 | 中國新創公司,專注於世界模型。 | WorldArena 基準測試中具身世界模型類別排名第一,超越 NVIDIA Cosmos-Predict 2.5 |
| AgiBot GenieEnvisioner-Sim2.0-2B | 影片世界模擬器 | 中國大型機器人公司,專注於感知軌道。 | 在感知軌道基準測試中領先 |
| Google DeepMind RT-1 | VLA (視覺-語言-行動) | 結合視覺、語言理解和運動控制的單一模型,直接作用於真實機器人。 | - |
| Google DeepMind Genie | 世界模型 | 從未標記的網路影片中學習互動環境,用於通用模擬。 | - |
| Figure AI Helix | VLA (視覺-語言-行動) | 運行於 Figure 02 人形機器人,使用基於擴散的動作生成。 | - |
| Physical Intelligence π0.5 | VLA (視覺-語言-行動) | 使用基於擴散的動作生成,透過異構任務的共同訓練實現廣泛泛化。 | - |
| OpenVLA | VLA (視覺-語言-行動) | 開源模型,基於 Llama2、DINOv2 和 SigLIP,70 億參數。 | - |
🛠️ 技術深入
- 世界行動模型 (WAM):採用聯合影片-動作擴散 Transformer (Joint Video-Action Diffusion Transformer, DiT) 架構,共同預測未來的潛在視覺標記和相應的機器人動作,而非將世界建模和動作預測視為獨立階段。
- NVIDIA Cosmos 3:一個全模態世界模型,基於統一的 Transformer 混合架構 (Mixture-of-Transformers, MoT),結合自回歸 (AR) Transformer 進行推理和擴散 (DM) Transformer 進行多模態生成,支援語言、圖像、影片、音訊和動作序列。
- NVIDIA GR00T N1.6:專為人形機器人設計的 VLA 模型,採用雙系統架構,其中一個視覺-語言模型 (VLM) 負責感知,另一個系統負責生成運動動作。其訓練數據包含異構混合數據,如機器人軌跡、人類影片和合成數據集。
- NVIDIA Eureka:一個 AI 代理,利用 OpenAI 的 GPT-4 大型語言模型自主編寫獎勵演算法,以訓練機器人進行強化學習。它與 NVIDIA 的 Isaac Gym 物理模擬平台整合,以加速訓練過程。
- Cosmos Policy:透過對 Cosmos Predict(一個世界基礎模型)進行後訓練來實現機器人控制和規劃。它將機器人動作、物理狀態和成功分數編碼為額外的潛在幀,並使用與影片生成相同的擴散過程進行學習。
🔮 前景展望AI analysis grounded in cited sources
具身智慧機器人將加速普及於工業與消費領域。
NVIDIA Isaac GR00T 參考人形機器人平台等開放式設計,降低了開發門檻,並結合 VLA/WAM 模型提升了機器人的泛化能力和適應性。
機器人訓練將更依賴大規模合成數據與影片預訓練。
實體機器人數據收集成本高昂且缺乏多樣性;WAMs 透過網路規模影片預訓練及合成數據生成,能有效學習物理動態並實現零樣本泛化。
具備推理能力的 VLA 模型將成為自動駕駛和複雜機器人任務的關鍵。
推理型 VLA 模型能將複雜任務分解為子問題,並生成可解釋的推理過程,顯著提高自動系統在複雜環境中執行任務的準確性和安全性。
⏳ 時間線
2023-10
NVIDIA Eureka 發布,利用 GPT-4 自動生成機器人獎勵演算法。
2025-01
NVIDIA 發布新的 Cosmos 和 GR00T 開放模型及數據,以及 Isaac Lab-Arena 用於機器人評估。
2025-03
NVIDIA 發布 GR00T N1,一個用於人形機器人的 VLA 模型。
2026-01
NVIDIA 推出 Cosmos Policy,利用 Cosmos 世界基礎模型進行機器人控制和規劃。
2026-05
NVIDIA 在 COMPUTEX 2026 推出 Cosmos 3,一個全模態世界模型套件。
2026-06
NVIDIA 推出 Isaac GR00T 參考人形機器人平台,結合 Unitree 硬體、Sharpa 靈巧手和 Jetson Thor 計算。
📎 來源 (22)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog ↗
每週 AI 簡報
每週一封,可隨時退訂。
