
機器人領域中 World-Action Models 的崛起
NVIDIA 探討了透過 Vision-Language-Action (VLA) 與 World-Action Models (WAM) 演進的機器人策略。這些架構利用預訓練的骨幹模型,成功連結視覺感知與物理執行之間的鴻溝。
Tag: #world-models97 results

NVIDIA 探討了透過 Vision-Language-Action (VLA) 與 World-Action Models (WAM) 演進的機器人策略。這些架構利用預訓練的骨幹模型,成功連結視覺感知與物理執行之間的鴻溝。
Decart 發布了 Oasis 3,這是一個能夠即時生成逼真駕駛環境的世界模型。該工具現已透過 API 開放,為開發人員提供了一個測試自動駕駛系統的平台。

Peking University 的研究團隊發表了 EvoPhys-World,這是一款具備自我演化能力的 5D 世界模型。該模型利用國產運算基礎設施,實現了高水準的場景控制。

Yann LeCun 正全力押注「世界模型」作為 AI 的下一個前沿領域。全球領先的視覺 AI 團隊目前已在積極研發並部署這些複雜的隱空間架構。

本研究指出,現有的具身智能世界模型因過度關注視覺預測而忽略了物理可行性。研究提出了一種模組化、查詢條件化的框架,旨在識別回答干預查詢所需的最低限度物理抽象。

Nvidia 與清華大學研究人員發表了 Gamma-World,這是一種旨在從單一智能體環境轉向複雜多智能體互動的世界模型。該研究旨在提升 AI 訓練模擬環境的真實感與可擴展性。
江行智能提出工業物理AI三層全棧架構,專注於整合數據基礎設施、世界模型與基於Agent的執行能力,以解決複雜的工業任務。

HiDream.ai 正式發布了擁有超過兩千億參數的圖像生成模型 HiDream-O1-Image-Pro。該公司正加速融資進程,以支持其邁向世界模型的發展目標。

Google DeepMind 已將 20 年的 Street View 影像整合至其 Project Genie 世界模型中。這讓使用者能夠探索由 AI 生成、具互動性的真實地點模擬場景。

PROMETHEUS 是一個將非結構化研究數據、代碼和文獻轉化為可導航「因果地圖集」的新框架。它使研究人員能夠將局部因果主張整合為連貫的 Topos 世界模型,從而促進更好的證據追蹤與反事實測試。