來源最新收集於 14h

JD.com 開源影音世界模型

閱讀原文: Pandaily
#world-model#embodied-ai

JD.com 開源影音世界模型,方便開發者進行導航與具身 AI 實驗。

30 秒速覽

有什麼變化

JoyAI-EchoWM 與 EchoWM-Flash 現已開源

為什麼重要

開源可能加速互動式世界模型與具身智能體的研究。JD.com 計畫建置國產 GPU 叢集及 Logistics Superbrain 3.0,也顯示其正推動 AI 更廣泛應用於物流。

下一步行動

下載 JoyAI-EchoWM 並重現其 WBench Navigation 設定,以評估影音世界模型在你自身具身智能體任務上的表現。

誰應關注:Researchers & Academics

關鍵要點

  • JoyAI-EchoWM 與 EchoWM-Flash 現已開源
  • 模型在 WBench Navigation 的得分約為 81.6–81.7
  • 模型結合相機意圖控制與原生音訊影片生成

深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

增強重點摘要

  • 該模型發布隸屬於京東「JoyAI:躍入物理世界」年度戰略,旨在將多模態基底模型與實體供應鏈、自動化履約深度串聯。
  • 京東同步推出物流超級大腦 3.0(Logistics Superbrain 3.0),具備在數秒內完成數億件包裹即時路徑最佳化的運算能力。
  • 京東雲揭露底層基礎設施計畫,全面部署大規模國產 GPU 集群,以支援實體世界模型的訓練與推論自主可控。
  • EchoWM 系列延續了京東 2026 年 JoyAI 佈局,接續 3 月發布的 JoyAI-LLM Flash 與 6 月開源的 JoyAI-VL-Interaction 視覺語言串流模型。
  • 模型支援使用者透過明確的相機姿態與意圖指令主動導航進入即時生成環境,擺脫傳統被動式影片撥放的生成邏輯。

競品分析

JoyAI-EchoWM / Flash
開發組織
京東 (JD.com)
開源狀態
開源
核心特性 / 控制方式
原生影音共生、統一相機意圖即時互動控制
基準測試與技術重點
WBench Navigation 得分約 81.6–81.7 分
Atlas
開發組織
World Labs
開源狀態
閉源 / 商業探索
核心特性 / 控制方式
空間智慧(Spatial Intelligence)、大型 3D 世界生成
基準測試與技術重點
聚焦生成具 3D 持久性的實體環境場景
LingBot-World
開發組織
開源研究社群
開源狀態
開源
核心特性 / 控制方式
開源即時互動世界模型架構
基準測試與技術重點
提供開源社群空間導航基準與互動模擬環境

技術深入

  • 原生影音共生生成(Native Audiovisual Co-generation):同時合成動態視覺畫面與精確同步的音訊流,解決傳統多模態模型後製合成的音畫不同步問題。
  • 統一相機意圖控制(Unified Camera-Intent Control):深度融合外在相機姿態(Camera-pose)與使用者意圖導引,實現具身視角下主動導航而非單純被動幀預測。
  • 高物理連續性導航架構:在空間基準 WBench Navigation 取得 81.6–81.7 分,展現對物理世界幾何形變與遮擋關係的建模能力。
  • 雙階模型架構部署:同步推出高精度旗艦模型 JoyAI-EchoWM 與針對推論延遲優化的 EchoWM-Flash,兼顧複雜渲染與即時互動需求。
  • 國產算力叢集適配:整合京東雲專屬國產 GPU 叢集進行分散式訓練與低延遲推論加速優化。

前景展望基於引用來源的 AI 分析

京東將加速物流自動化體系向空間智慧全面轉型
藉由將 EchoWM 互動世界模型與物流超級大腦 3.0 深度整合,實體倉儲機器人與配送排程將具備即時空間場景模擬與預測能力。
生成式 AI 典範將由被動影片生成轉移向雙向互動式世界模擬
結合相機意圖控制與同步影音的開源模型落地,將促使具身智慧開發者轉向使用即時渲染世界模型作為機器人訓練沙盒。

時間線

2026-03
發布指令微調基底模型 JoyAI-LLM Flash
2026-06
開源 JoyAI-VL-Interaction 即時視覺語言流模型
2026-09
於 JDD 大會開源 JoyAI-EchoWM 與 EchoWM-Flash,並發表物流超級大腦 3.0

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。