物理 AI 的崛起:VLA 與世界模型
產業正轉向「物理 AI」作為下一個兆級美元市場,重點在於整合視覺-語言-動作 (VLA) 模型與世界模型,以實現機器人對物理空間的理解與導航。
Tag: #world-models97 results
產業正轉向「物理 AI」作為下一個兆級美元市場,重點在於整合視覺-語言-動作 (VLA) 模型與世界模型,以實現機器人對物理空間的理解與導航。
酷哇科技 (Coowa) 推出 CooWAIM,這是一個專為涵蓋環衛、物流等五大場景的具身智能而設計的通用世界模型。該公司採用「以戰養戰」的訓練策略,部署數千台機器人以收集真實世界數據,推動模型持續進化。

AutoWorldModel-Bench 評估前沿程式代理是否能透過開放式研究自主改進世界模型,而非只完成預先定義的工程任務。在 64 次測試與 8 個遊戲環境中,Codex-5.4 和 Claude Opus 4.6 在 63 次測試裡改進了起始模型,且多數勝出修改都涉及實質性的研究變更。

影溯正在開發一套系統,將海量網路影片轉換為可用於訓練世界模型與具身 AI 的結構化 3D/4D 資料。公司計畫今年支援從單目影片轉換為 360 度動態場景,並在完成新一輪融資後開始批量轉制。

TaskSense 提出以任務為中心的世界模型架構,透過隨機空間注意力與反向動力學監督,讓表示聚焦於與控制相關的區域。在 DeepMind Control Suite 上,它維持與 DreamerV3 相當的表現,並在具視覺干擾的環境中大幅勝出。
至少五家中國具身智能公司——智平方、自变量、星海图、千寻智能與银河通用——投後估值已超過200億元人民幣。它們的估值不僅取決於目前的出貨量,更反映基座模型架構、資料閉環與商業化潛力。

DeepSeek 的營運公司以約人民幣 1.41 億元參與 Unitree IPO 戰略配售,獲配 933,399 股,並承諾 36 個月鎖定期。這項少數股權投資可能把 DeepSeek 的模型、推理與基礎設施能力,連結至 Unitree 的具身機器人平台;但目前尚未披露具體的聯合模型或資料共享安排。

CASIA 研究人員發表 PhiZero,這是一個先以學習而來的離散「物理語言」進行推理,再生成影片的世界模型。該方法將表示四秒影片所需的 token 數量降低約 175 倍。
機器人運營平台AIROBO完成數億元首輪融資,資金已全額交割,創下中國機器人運營賽道最大首輪融資紀錄。公司將建設城市級運營網絡,拓展社區物業場景,並研發機器人世界模型。
世界模型在 2026 年成為資本與人才高度集中的熱門賽道,字節跳動前研究員與產品高管密集創業,或轉投 Google、OpenAI、Meta、Apple 等公司。這些創業項目主要分布於影片生成、具身智能與 Physical AI 基礎模型三個方向。