💰钛媒体•較早收集於 3h
WAM 是否會取代 VLA 成為機器人技術的未來?

💡掌握機器人領域下一個可能定義下一代具身智能的重要架構轉變。
⚡ 30-Second TL;DR
有什麼變化
機器人領域中 VLA 與 WAM 架構的辯論
為什麼重要
向 WAM 的轉變可能會重新定義機器人感知與互動物理世界的方式。研究人員應密切關注此架構轉型。
下一步行動
為您的下一個機器人專案評估基於 WAM 的框架,並與傳統 VLA 模型進行效能比較。
誰應關注:Researchers & Academics
關鍵要點
- •機器人領域中 VLA 與 WAM 架構的辯論
- •具身智能 (Embodied AI) 出現「GPT 時刻」的潛力
- •VLA 模型在現實部署中的當前局限
🧠 深度解析
Web-grounded analysis with 23 cited sources.
🔑 增強重點摘要
- •世界動作模型 (WAM) 雖然在處理視覺擾動(如噪音、光線變化和雜亂環境)方面表現出更高的穩健性,但其推論速度顯著慢於視覺語言動作模型 (VLA),這對即時部署構成了挑戰。
- •VLA 模型通常透過對大規模視覺語言模型 (VLM) 進行微調來構建,這些模型利用視覺觀察、語言指令和機器人軌跡數據進行訓練,並結合視覺語言編碼器和動作解碼器來直接輸出低階機器人動作。
- •機器人學習的主要數據來源預計將從昂貴的人工遠程操作轉向網路上隨處可見的第一人稱人類影片,這將有利於 WAM 模型的發展。
- •OpenAI 在 2021 年暫停機器人研究轉而專注於大型語言模型後,於 2025 年重新組建機器人團隊,積極招募類人機器人系統專家,並探索遠程操作和模擬技術以收集數據。
- •Meta AI 正透過觸覺感知、靈巧性和人機互動方面的研究推進具身智能,並已釋出 Meta Sparsh(通用觸覺編碼器)和 Digit 360(觸覺感測器)等研究成果,同時於 2026 年收購了機器人 AI 新創公司 Assured Robot Intelligence (ARI)。
📊 競品分析▸ Show
| 特性/指標 | 視覺語言動作模型 (VLA) | 世界動作模型 (WAM) |
|---|---|---|
| 核心理念 | 將視覺觀察和語言指令直接映射到機器人動作,作為多模態序列建模任務。 | 透過預測環境的未來狀態和機器人為影響該狀態而採取的動作,來學習世界動態。 |
| 主要訓練數據 | 大規模視覺語言模型 (VLM) 經由視覺觀察、語言指令和機器人軌跡數據進行微調。 | 大規模影片數據集 (包括網路影片和第一人稱人類影片),以學習時空動態。 |
| 泛化能力 | 透過大規模多模態數據集訓練,可將知識轉移到未曾見過的指令,但對分佈外環境和訓練場景之外的泛化能力較弱。 | 透過對物理世界動態的內化模型,對新任務和環境具有更廣泛的泛化能力,尤其在零樣本場景下表現更佳。 |
| 對視覺擾動的穩健性 | 較為脆弱,對光線變化、感測器噪音或雜亂環境敏感,因為缺乏對世界動態的精細理解。 | 展現出更高的穩健性,能更好地處理視覺噪音和佈局變化,因為其影片生成骨幹能原生理解物理。 |
| 推論速度 | 較快,計算開銷較低,響應速度快,可在邊緣設備上運行。 | 顯著較慢,推論速度可能比最佳 VLA 慢 83 倍,使其難以即時部署。 |
| 精細控制能力 | 在需要毫米級定位或雙臂協調的精確組裝任務中表現較強。 | 在精確組裝等任務中表現明顯較弱,因為影片生成更側重於像素級一致性而非關節級精細控制。 |
| 長期任務能力 | 通常只能處理包含兩到三個動作的簡單任務,時間序列稍長就容易迷失。 | 在長期任務能力方面有所進展。 |
| 數據收集成本 | 長期以來受限於昂貴的遠程操作數據,需要即時人工控制和實機操作。 | 可以從大量現成且日常生成的人類第一人稱影片中學習,降低數據收集成本。 |
🛠️ 技術深入
- VLA 模型架構: 通常建立在預訓練的視覺語言模型 (VLM 之上,將攝影機影像和語言指令編碼為潛在表示。動作解碼器隨後生成低階機器人動作。它可以是端到端的單一網路,也可以是包含獨立 VLM 和動作解碼器的雙系統。
- VLA 數據處理: VLA 模型利用 Transformer 架構,將影像、語言和動作轉換為共享詞彙空間中的「tokens」,例如 400 個視覺 tokens、12 個語義語言 tokens 和 64 維的機器人關節狀態 tokens。
- WAM 模型架構: 建立在明確預測環境未來狀態的世界模型之上。它們通常透過大規模影片數據集進行預訓練,以學習時空動態。核心思想是透過理解場景如何隨時間變化來推導策略。
- WAM 運作方式: WAM 作為一個統一的端到端模型運行,通常是一個聯合影片-動作擴散 Transformer (DiT),它共同預測未來的潛在視覺 tokens 和相應的機器人動作。級聯 WAMs 則分兩步工作:世界模型首先生成未來影像/影片,然後第二個模組從該輸出中提取控制指令。
- VLA 訓練數據: 需要同步的多攝影機影片、自然語言任務描述以及每個示範步驟的時間戳動作標籤。
- WAM 訓練數據: 利用網路規模的影片數據,包括第一人稱人類視角影片,以發展對物理、運動和互動的內化模型。
- VLA 挑戰: 在將連續動作映射到離散表示時存在量化誤差,並且在高頻控制應用中面臨計算挑戰。它們對分佈偏移敏感,且「模擬到現實」的鴻溝依然存在。不同機器人實體之間的動作異質性也是一個根本挑戰。
- WAM 挑戰: 主要挑戰在於顯著較慢的推論速度,這限制了其在需要即時響應的應用中的部署。
🔮 前景展望AI analysis grounded in cited sources
未來機器人學習的數據來源將從昂貴的遠程操作轉向大規模的網路影片。
WAMs 能夠從現成的人類第一人稱影片中學習物理世界,顯著降低數據收集成本並加速模型訓練。
混合式機器人架構將成為主流,結合 VLA 的精細控制與 WAM 的世界理解能力。
雖然 WAM 在泛化和穩健性方面表現優異,但 VLA 在精確控制和即時部署方面仍有優勢,兩者結合可彌補各自的不足。
具身智能的「GPT 時刻」將由能夠在未知環境中執行複雜任務的通用機器人來定義。
業界領袖將機器人領域的「ChatGPT 時刻」定義為機器人首次能在未曾到訪的環境中執行複雜任務的能力。
⏳ 時間線
2010s-2020s
深度學習與模擬技術的結合,推動具身智能代理能夠透過試錯學習。
2021-07
OpenAI 暫停機器人研究,轉而專注於大型語言模型。
2023-07
Google DeepMind 推出 RT-2,一個為端到端操作任務改編的 VLM,開創了 VLA 概念。
2025-09
OpenAI 重新組建機器人團隊,標誌著其戰略性回歸實體 AI 系統。
2026-04
華為技術與多倫多大學的研究人員發表了一項比較 WAM 和 VLA 策略的研究,指出 WAM 在視覺擾動方面具有更強的穩健性,但推論速度較慢。
2026-05
NVIDIA 機器人方向負責人 Jim Fan 在 AI Ascent 2026 會議上提出「VLA 已死,WAM 應當崛起」的論斷,引發具身智能領域的熱議。
📎 來源 (23)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 钛媒体 ↗
