🐼較早收集於 77m

Alibaba 推出 Qwen-VLA 模型,正式進軍具身智慧領域

Alibaba 推出 Qwen-VLA 模型,正式進軍具身智慧領域
PostLinkedIn
🐼閱讀原文: Pandaily

💡Alibaba 首度進軍具身智慧;為構建物理世界代理提供新的開源權重競爭者。

⚡ 30-Second TL;DR

有什麼變化

Qwen-VLA 是 Alibaba 首款視覺-語言-動作模型。

為什麼重要

此發布將開源視覺-語言模型的生態系統擴展至機器人領域,可能降低開發者構建物理代理的門檻。

下一步行動

查閱 Qwen-VLA 文件,了解如何將其視覺-動作能力整合至現有的機器人模擬環境中。

誰應關注:Developers & AI Engineers

關鍵要點

  • Qwen-VLA 是 Alibaba 首款視覺-語言-動作模型。
  • 該模型專為具身智慧應用進行了優化。
  • 標誌著 Alibaba 戰略性轉向物理世界 AI 整合。

🧠 深度解析

Web-grounded analysis with 18 cited sources.

🔑 增強重點摘要

  • Qwen-VLA 是一款統一的具身基礎模型,它將機器人操作、導航和軌跡預測這三種異構任務整合到單一的視覺-語言-動作(VLA)框架中,打破了以往任務專用模型的碎片化格局。
  • 該模型透過「形態感知提示條件化」(embodiment-aware prompt conditioning)機制,利用對機器人平台和控制規範的文本描述,實現了單一模型跨多個機器人平台(例如11種不同平台)的適應性。
  • Qwen-VLA 的核心架構結合了 Qwen3.5-4B 多模態骨幹網路和一個擁有 11.5 億參數的 Diffusion Transformer (DiT) 動作解碼器,用於生成連續的物理動作。
  • 模型的訓練採用了漸進式的四階段方法,包括文本到動作預訓練、持續預訓練、監督微調和強化學習,以逐步調整異構數據中的視覺、語言和動作。
  • 阿里巴巴在具身智慧領域採取「軟體+硬體+生態」的全鏈路策略,除了開發 Qwen-VLA 等模型外,還投資了宇樹科技、逐際動力等機器人硬體公司,並探索自研四足和人形機器人產品。

🛠️ 技術深入

  • 模型架構: Qwen-VLA 整合了 Qwen3.5-4B 多模態骨幹網路與一個 11.5 億參數的 Diffusion Transformer (DiT) 動作解碼器,將視覺-語言建模棧從感知、理解與推理擴展至連續動作與軌跡生成。
  • 統一任務框架: 該模型將機器人操作、視覺語言導航和軌跡預測等異構具身任務統一到單一的 VLA 框架中。
  • 跨平台泛化: 透過「形態感知提示條件化」機制實現,即透過文本描述當前機器人平台與控制規範,使模型能適應多種機器人硬體。
  • 訓練數據: 涵蓋多平台機械臂操作軌跡、人類第一人稱演示、大規模合成仿真數據、視覺語言導航數據、以軌跡為中心的監督信號以及輔助視覺語言數據。
  • 訓練流程: 採用漸進式四階段訓練配方:
    • 文本到動作 (T2A) 預訓練: 凍結 VLM,純文本訓練 DiT 解碼器,使其學習動作分佈、文本-動作對齊、形態條件化和流匹配動力學。
    • 持續預訓練: 解凍 VLM,引入 Beta 分佈,開啟相機,將語言先驗與視覺觀察結合。
    • 監督微調 (SFT): 針對多任務評估軌跡進行微調。
    • 強化學習 (RL): 應用於策略。
  • 性能基準: 在 LIBERO 基準測試中達到 97.9%,Simpler-WidowX 達到 73.7%,RoboTwin-Easy/Hard 分別達到 86.1%/87.2%,視覺語言導航 R2R OSR 達到 69.0%、RxR SR 達到 59.6%,真實世界 ALOHA 實驗 OOD 平均成功率為 76.9%,DOMINO 動態操作零樣本成功率為 26.6%。
  • 論文發表: 相關研究論文已發布於 arXiv (2605.30280v1)。

🔮 前景展望AI analysis grounded in cited sources

Qwen-VLA 的統一框架將加速通用機器人的發展。
透過將多樣化的具身任務整合到單一模型中,並實現跨平台適應性,Qwen-VLA 減少了對特定任務或硬體模型的依賴,從而簡化了開發和部署流程。
阿里巴巴的「軟體+硬體+生態」策略將鞏固其在物理 AI 市場的地位。
結合 Qwen-VLA 等先進 AI 模型與對機器人硬體的投資,以及廣泛的應用生態系統,使阿里巴巴能夠建立一個全面且自我強化的 AI 開發與部署循環。
阿里巴巴在具身智慧領域的開源策略將加速行業發展。
阿里巴巴通義系列模型一直秉持開源策略,若 Qwen-VLA 未來開源,將為全球開發者提供強大的基礎模型,降低具身智慧應用的開發門檻。

時間線

2023-04
阿里巴巴雲發布通義千問大語言模型,正式進入大模型領域。
2023-09
通義千問正式向社會公眾開放。
2024-01
Qwen-VL 系列(Qwen-VL-Plus 和 Qwen-VL-Max)發布,增強視覺推理能力。
2025-04
新一代模型 Qwen3 正式開源,涵蓋多種尺寸和架構。
2025-10
阿里巴巴通義千問部門成立機器人與具身智慧小組。
2026-05
阿里巴巴通義團隊正式發布 Qwen-VLA 模型。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily