🐯虎嗅•較早收集於 23m
Jim Fan 對 2040 年具身智能機器人的願景

💡Nvidia 頂尖 AI 科學家揭示 2040 年實現自主機器人的技術路線圖。
⚡ 30-Second TL;DR
有什麼變化
提出「大平行」(Great Parallel)策略:將 LLM 的訓練路徑(預訓練、微調、強化學習)應用於機器人領域。
為什麼重要
該框架為機器人產業提供了清晰的技術路線圖,強調生成式 AI 與物理模擬的融合,以解決機器人領域的數據稀缺問題。
下一步行動
探索 Nvidia 的 GEAR 研究與 DreamZero 模型,了解如何將世界狀態預測整合到您的機器人控制堆疊中。
誰應關注:Researchers & Academics
關鍵要點
- •提出「大平行」(Great Parallel)策略:將 LLM 的訓練路徑(預訓練、微調、強化學習)應用於機器人領域。
- •主張以「世界動作模型」(WAM)取代 VLA,重點在於預測物理世界狀態,而非僅僅是語言條件下的動作。
- •從遙操作轉向「傳感器化人類數據」(帶手部追蹤的第一人稱視角影片),以實現可擴展的訓練。
- •預測 2040 年為機器人發展的「終局」,包括自主自我設計與工廠級物理 API 的實現。
🧠 深度解析
Web-grounded analysis with 16 cited sources.
🔑 增強重點摘要
- •「大平行」策略明確將大型語言模型(LLM)的演進路徑(預訓練、對齊、推理、自主研究)應用於機器人領域,作為其發展的藍圖。
- •「世界動作模型」(WAM)與傳統的視覺-語言-動作(VLA)模型不同,WAM以影片為優先,共同解碼未來的世界狀態和動作,更側重於物理定律和動詞,而非VLA模型中語言優先的知識和名詞。
- •「傳感器化人類數據」的具體實踐包括利用可穿戴設備(如外骨骼、手套、動作捕捉)和以自我為中心的第一人稱視角影片來捕捉人類活動,例如EgoScale項目展示了21,000小時的自我中心影片數據能有效預測機器人成功,大幅減少對緩慢遙操作的依賴。
- •「物理圖靈測試」的定義是機器人執行物理任務的能力達到與人類難以區分的優雅程度,Jim Fan預測機器人將在2026年後的2-3年內通過此測試。
- •到2040年,機器人發展的「終局」將包括實現「物理自動研究」,即機器人能夠自主設計、改進並建造下一代自身,以及實現工廠級的「物理API」,讓機器人能像軟體操作位元一樣輕鬆地操縱原子。
🛠️ 技術深入
- 世界動作模型 (WAM) 架構: WAMs 統一了預測性世界建模與動作生成,其目標是
p(o', a | o, l),這意味著它們在當前觀察 (o) 和語言指令 (l) 的條件下,共同預測未來的觀察 (o') 和可執行動作 (a)。這與僅預測p(o' | o, a)的世界模型 (WMs) 或僅預測p(a | o, l)的視覺-語言-動作 (VLA) 模型不同。 - Dream Zero: NVIDIA 的 Dream Zero 是一種 WAM,它共同解碼下一個世界狀態(影片幀)和下一個動作。它能夠「夢想」未來幾秒鐘的場景並據此行動,從而實現對未曾見過的動詞和名詞的零樣本任務解決。其有效性與影片預測緊密相關:如果影片預測成功,動作也會成功;如果影片產生幻覺,動作就會失敗。
- EgoScale: 此項目證明,21,000小時的野外自我中心人類影片數據(預訓練期間不含任何機器人數據)可以有效預測機器人的成功,僅需50小時的高精度動作捕捉手套數據和4小時的遙操作數據即可進行動作微調。它還展示了靈巧度的神經縮放定律。
- DreamDojo: 這是 NVIDIA 的神經模擬器,是影片世界模型的一種變體,它接收連續的動作信號並即時輸出下一個 RGB 幀和感測器狀態。它純粹透過數據驅動的方式學習機器人的機械原理,無需物理方程式或圖形引擎,並驅動一個大規模並行強化學習系統。
- 「大平行」策略階段: 該策略將 LLM 的成功路徑應用於機器人,包括:預訓練(世界模型預測下一個物理狀態)、對齊(在少量真實機器人數據上進行動作微調)、推理(使用強化學習)和最終的自主研究。
- 數據策略: NVIDIA 的方法結合了網際網路規模的數據、模擬數據和真實世界機器人數據,以創建強大的 AI 模型。
🔮 前景展望AI analysis grounded in cited sources
具身智能機器人將在未來2-3年內通過「物理圖靈測試」。
Jim Fan預測機器人將在執行任務時展現出與人類難以區分的優雅,這將是具身智能發展的一個關鍵里程碑。
到2040年,機器人將實現「物理自動研究」,能夠自主設計、改進並製造下一代機器人。
這一預測基於AI技術的指數級進步,將使機器人能夠超越人類能力,加速自身的發展循環。
「世界動作模型」(WAM)和「傳感器化人類數據」將成為機器人訓練的主導範式,取代傳統的VLA模型和遙操作。
WAMs更注重物理世界狀態預測,而傳感器化數據提供可擴展且高效的訓練方式,解決了遙操作的數據瓶頸。
⏳ 時間線
2016
Jim Fan作為OpenAI的首批實習生之一,參與了World of Bits項目,該項目旨在讓代理通過像素感知網頁並輸出鍵盤/鼠標控制。
2022
MineDojo項目(由Jim Fan主導)在NeurIPS 2022上獲得傑出論文獎,該項目旨在通過觀看數十萬小時的Minecraft YouTube視頻來構建開放式具身代理。
2023
Eureka項目(由Jim Fan團隊主導)利用GPT-4編寫獎勵函數,訓練五指機器人手執行諸如轉筆等靈巧任務,被評為NVIDIA 2023年十大項目之一。
2024-09
Jim Fan領導NVIDIA的具身AI「GEAR」(Generalist Embodied Agent Research)團隊,專注於為物理機器人和虛擬環境開發AI代理。
2025-05
Jim Fan在AI Ascent 2025上介紹了「物理圖靈測試」的概念,並強調大規模模擬是機器人發展的關鍵。
2026-05
Jim Fan在Sequoia Capital的AI Ascent 2026上發表了關於機器人「終局」策略的演講,提出了「大平行」和「世界動作模型」(WAM)的概念。
📎 來源 (16)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗



