⚛️較早收集於 77m

李飛飛親自下場定義世界模型

李飛飛親自下場定義世界模型
PostLinkedIn
⚛️閱讀原文: 量子位

💡了解可能定義下一代具身智慧的世界模型新範式。

⚡ 30-Second TL;DR

有什麼變化

渲染、模擬與規劃功能的深度整合

為什麼重要

此概念轉變為研究人員提供了一條路線圖,有助於構建更具凝聚力的 AI 系統,以更好地理解並與物理世界互動。

下一步行動

閱讀李飛飛關於世界模型的最新研究論文,將您的架構與模擬及規劃的融合趨勢保持一致。

誰應關注:Researchers & Academics

關鍵要點

  • 渲染、模擬與規劃功能的深度整合
  • 重新定義世界模型能力的邊界
  • 推動具身智慧的基礎理解

🧠 深度解析

Web-grounded analysis with 29 cited sources.

🔑 增強重點摘要

  • 李飛飛提出的世界模型框架將其功能明確劃分為渲染器、模擬器和規劃器三大類,並強調模擬器作為連接渲染與規劃的關鍵橋樑,其重要性常被低估。
  • 她指出,目前許多被稱為「世界模型」的渲染器(如部分影片生成模型)雖視覺逼真,但缺乏物理精確性,不適用於建築設計或機器人訓練等需要與現實世界緊密結合的應用場景。
  • 李飛飛共同創辦的World Labs已推出首款商業產品Marble,這是一個生成式世界模型,能夠從文字、圖像、影片或粗略空間佈局等多模態輸入,生成可編輯、持久且可導出的3D環境。
  • World Labs的Marble模型基於即時幀模型(Real-Time Frame Model, RTFM)架構,能在單一Nvidia H100 GPU上即時運行,並生成具有物體永恆性和視角一致性的連貫3D世界,而非簡單的影片序列。
  • 李飛飛將「空間智慧」定義為繼大型語言模型(LLMs)之後的下一個AI前沿,旨在讓AI超越語言的限制,具備感知、理解和推理物理世界的能力,以實現更廣泛的具身智慧應用。
📊 競品分析▸ Show
參與者/模型主要方法/焦點特點
李飛飛 / World Labs (Marble)空間智慧 / 顯式3D世界生成創建可編輯、持久、可導出的3D環境,強調渲染、模擬、規劃的整合,支援多模態輸入,旨在實現物理一致性。
Yann LeCun / AMI Labs (JEPA)聯合嵌入預測架構 (JEPA) / 隱式抽象表示在抽象表示空間中預測未來,而非像素級生成,強調資料效率和對物理世界的概念化理解。
Google DeepMind (Genie 3, SIMA)學習型模擬 / 虛擬環境代理人Genie 3生成具備物理真實度(流體力學、碰撞邏輯)的可互動3D空間,用於訓練具身代理人SIMA。
NVIDIA (Cosmos, Project GR00T)物理AI基礎設施 / 世界基礎模型提供用於訓練機器人和自動駕駛的合成資料和3D模擬平台,Cosmos模型已使用大量真實世界影片訓練。
DeepMind (Dreamer 系列)循環狀態空間模型 (RSSM) / 潛在空間動力學強化學習領域主流架構,結合確定性與隨機性路徑,在潛在空間中建模環境動態,實現高效樣本學習。
OpenAI (Sora)影片生成模型能夠生成高品質影片,但被認為主要在像素層面記憶紋理變化,而非真正理解物理世界和因果關係,缺乏互動性。

🛠️ 技術深入

  • 李飛飛 World Labs (Marble/RTFM)
    • 核心架構:即時幀模型(Real-Time Frame Model, RTFM),旨在生成持久、可導航的3D環境,具備物體永恆性和跨視角幾何一致性。
    • 輸入模態:支援文字、圖像、影片、粗略空間佈局等多種輸入形式。
    • 輸出能力:生成可編輯的3D環境,可導出為USD或PLY等標準格式,無縫整合至遊戲引擎(如Unreal Engine 5)或數位孿生軟體。
    • 交互層 (Chisel):實驗性3D編輯器,允許用戶透過方塊或平面定義空間結構,再結合文字提示自動填充風格,實現結構與風格的分離控制。
    • 運行效率:可在單一Nvidia H100 GPU上實現即時運行。
  • 世界模型通用技術組成
    • 狀態表徵 (State Representation):從高維、嘈雜的觀測數據(如圖像、感測器讀數)中提取緊湊且有意義的內部狀態(潛在狀態)。
    • 動態預測 (Dynamics Prediction):根據當前狀態和假設動作,預測環境未來的狀態變化。
    • 基於想像的規劃 (Planning inside Imagination):在內部模型中進行多步推演,評估不同決策路徑的長期後果,減少真實環境中的試錯成本。
    • 潛在空間動力學 (Latent Space Dynamics):許多世界模型(如Dreamer系列)透過在壓縮的潛在空間中建模環境動態來運作。
    • 物理引擎融合:將Motive、HWM等物理引擎的規則融入世界模型,以精準模擬物理現象,提升建模精度和物理一致性。

🔮 前景展望AI analysis grounded in cited sources

世界模型將加速具身智慧在現實世界的部署。
透過在模擬環境中理解物理規律和因果關係,AI代理人能在進入現實世界前進行高效訓練和策略規劃,大幅降低試錯成本並提升安全性。
空間智慧將成為AI領域繼大型語言模型之後的下一個主要範式轉移。
李飛飛等領先研究者認為,僅靠語言模型無法實現通用人工智慧,AI需要具備對物理世界的感知、推理和互動能力,這將推動AI從認知走向行動。
世界模型將徹底改變創意產業的內容生成與互動方式。
像World Labs的Marble這類模型能夠從簡單輸入生成可編輯、持久的3D世界,將極大簡化遊戲、電影、VR/AR、建築設計等領域的內容創作流程。

時間線

2019
史丹佛大學以人為本人工智慧研究院 (Stanford HAI) 成立,李飛飛為共同主任。
2021-08
史丹佛HAI 舉辦首屆基礎模型研討會,李飛飛參與討論基礎模型的重要性。
2024年初
World Labs 成立,由李飛飛與Justin Johnson、Christoph Lassner、Ben Mildenhall 共同創立,旨在構建空間智能世界模型。
2025-11
李飛飛發表長文,系統性解釋空間智能和世界模型,並提出其三大核心能力:生成性、多模態、交互性。
2025-11
World Labs 推出首款商業化產品 Marble,一個可生成、編輯和導出3D世界的模型,基於Real-Time Frame Model (RTFM)。
2026-06
李飛飛撰文對世界模型進行功能分類,強調渲染、模擬與規劃的區別與融合。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位