
機器人領域中 World-Action Models 的崛起
NVIDIA 探討了透過 Vision-Language-Action (VLA) 與 World-Action Models (WAM) 演進的機器人策略。這些架構利用預訓練的骨幹模型,成功連結視覺感知與物理執行之間的鴻溝。
Tag: #vla27 results

NVIDIA 探討了透過 Vision-Language-Action (VLA) 與 World-Action Models (WAM) 演進的機器人策略。這些架構利用預訓練的骨幹模型,成功連結視覺感知與物理執行之間的鴻溝。

PersonaDrive 引入了一種 VLA 管線,根據人類風格的示範來調節自動駕駛代理。透過檢索增強生成,它能在無需針對每種風格重新訓練模型的情況下,實現激進、中性或保守等多樣化的駕駛行為。
地瓜機器人與千尋智能達成戰略合作,將 Spirit v1.5 VLA 模型與旭日 S600 晶片深度整合。此次合作旨在為機器人領域提供高性能、可量產的軟硬體一體化解決方案。

AI² Robotics創辦人郭彥東捍衛VLA為具身智能核心架構。公司推出腦啟發模型NeuroVLA。同時發布AlphaBrain平台,這是支援即插即用世界模型的開源工具包。

高德推出ABot-World世界模型,採用物理優先設計與VLA閉環進化,解決具身智能零樣本泛化難題。它具備高精渲染引擎,解決數據稀缺問題。此突破提升AI代理的模擬與真實世界適應能力。
PhAIL 是一個開放基準測試,用於在真實硬體上評估視覺-語言-動作 (VLA) 模型進行 bin-to-bin 訂單揀選。頂尖模型如 OpenPI 和 GR00T 分別達到 65 和 60 UPH,相比遙控操作的 330 UPH 和人類手的 1,331 UPH,平均故障間隔 (MTBF) 約 4 分鐘。所有數據、影片和提交工具均公開於 phail.ai。

西湖大學的 HiF-VLA 透過基於運動的回顧、洞察與預見建模,提升視覺語言動作模型在機器人任務的表現。它在 LIBERO-Long 單視角任務達到 94.4% 成功率,並在真實機器人長序列實驗中表現優異。此方法以更低計算成本超越基準,穩定性更佳。
理想汽車發布下一代自動駕駛基礎模型MindVLA-o1。該模型透過五大技術創新——3D空間理解、多模態思考、統一行為生成、閉環強化學習(Closed-loop RL)和軟硬體協同設計,構建面向物理世界智能的自動駕駛基礎模型。

Alibaba Cloud 正將雲端、晶片、模型與資料處理能力整合為一條服務中國智慧駕駛開發者的基礎設施產線。其方案涵蓋多模態資料接入、自動標註、模型訓練、世界模型模擬,以及異質國產晶片調度。

英偉達機器人負責人Jim Fan大膽宣稱視覺語言動作(VLA)模型與遙操為死路。這是他對機器人未來方向的最新暴論。