⚛️較早收集於 82m

阿里巴巴發布 Qwen-Robot 具身智能模型系列

阿里巴巴發布 Qwen-Robot 具身智能模型系列
PostLinkedIn
⚛️閱讀原文: 量子位

💡阿里巴巴進軍具身智能領域,推出賦予機器人現實世界推理能力的新模型系列。

⚡ 30-Second TL;DR

有什麼變化

阿里巴巴首個具身智能模型系列

為什麼重要

這標誌著阿里巴巴在機器人領域邁出了重要一步,有望縮小數位智慧與物理自動化之間的差距。

下一步行動

研究 Qwen-Robot 的技術文檔,了解如何將其推理能力整合到現有的機器人控制堆疊中。

誰應關注:Researchers & Academics

關鍵要點

  • 阿里巴巴首個具身智能模型系列
  • 實現機器人即時行走、視覺感知與思考能力
  • 專注於將 LLM 推理能力與物理世界交互結合

🧠 深度解析

Web-grounded analysis with 27 cited sources.

🔑 增強重點摘要

  • 阿里巴巴的Qwen-Robot系列包含三大核心模型:Qwen-RobotManip(視覺-語言-動作操作模型)、Qwen-RobotNav(視覺-語言導航移動模型)和Qwen-RobotWorld(影片世界模型),這些模型可獨立部署或協同運作,為機器人提供通用底座。
  • Qwen-RobotManip模型在超過38,000小時的開源語料上進行預訓練,並在RoboChallenge Table30 v1基準測試中,跨越30項真實世界任務和4個機器人平台,取得了領先的成績。
  • 該模型系列已與阿里巴巴雲的特定企業客戶在機器人領域進行真實世界的試點測試,旨在推動具身智能從實驗室走向商業化落地。
  • Qwen-RobotManip採用一套80維的統一動作表徵,為不同硬體定義了通用的「肢體語言」,並基於攝影機畫面中的相對位置進行操作,使其能更快、更準確地適應環境變化和不同機器人形態。
  • 阿里巴巴將具身智能視為大模型落地實體世界的關鍵方向,此舉有助於強化其在AI應用層與機器人產業鏈的戰略位置,並將AI從雲端推向實體世界。

🛠️ 技術深入

  • Qwen-Robot系列由三個核心模型組成:Qwen-RobotManip(視覺-語言-動作操作模型)、Qwen-RobotNav(視覺-語言導航移動模型)和Qwen-RobotWorld(影片世界模型)。
  • Qwen-RobotManip採用80維的統一動作表徵,以實現不同硬體平台間的通用性,並透過基於攝影機畫面的相對位置操作來提升環境適應性。
  • Qwen-RobotManip的預訓練使用了超過38,000小時的開源語料數據。
  • Qwen-VLA(與Qwen-RobotManip和Qwen-RobotNav相關)基於通義千問(Qwen)多模態骨幹模型構建,將視覺感知、語言理解和空間推理能力擴展到連續動作生成和軌跡預測。
  • Qwen-VLA的訓練流程分為四個階段:文本到動作(T2A)預訓練、持續預訓練(CPT)、監督微調(SFT)和強化學習(RL)。
  • Qwen-VLA的動作生成部分採用了一個1.15億參數的擴散變換器(Diffusion Transformer)動作解碼器。
  • 訓練數據混合了真實機器人數據、人類第一視角數據、合成模擬數據和通用視覺語言數據。
  • 通義千問3.5(作為底層骨幹模型)是一個總參數達3970億的模型,採用混合專家(MoE)架構,每次激活約170億參數。
  • 阿里巴巴的另一具身智能模型RynnBrain是一個開源基礎模型,具備時空記憶和物理世界推理能力,其中最引人注目的是業界首個30B MoE架構的具身模型,旨在減少幻覺問題。

🔮 前景展望AI analysis grounded in cited sources

阿里巴巴將加速其具身智能模型在工業和服務型機器人領域的商業化部署。
該模型系列已進入阿里巴巴雲企業客戶的實際試點測試,並被視為大模型落地實體世界的關鍵方向,有助於強化阿里在AI應用層與機器人產業鏈的戰略位置。
Qwen-Robot系列將推動具身智能行業標準化,降低不同硬體平台導入AI模型的門檻。
Qwen-RobotManip採用統一的動作表徵和基於相對位置的操作,旨在為不同形態的機器人提供通用底座,促進跨平台泛化能力。
阿里巴巴在具身智能領域的投入將加劇與全球科技巨頭如Google、NVIDIA和OpenAI的競爭。
阿里巴巴已明確表示將AI從雲端推向實體世界,並組建具身智能團隊,與其他巨頭在該賽道上展開激烈競爭。

時間線

2023-04
阿里巴巴推出通義千問(Qwen)大語言模型,為後續多模態及具身智能模型奠定基礎。
2025-10
阿里巴巴通義千問技術負責人林俊旸宣布組建「機器人與具身智能小組」,正式進軍物理AI領域。
2026-02
阿里巴巴發布RynnBrain開源具身智能基礎模型,具備時空記憶和物理世界推理能力。
2026-04
高德「途途」人形機器人亮相,標誌著阿里巴巴開始切入具身智能硬體終端應用。
2026-05
Qwen-VLA模型相關論文發布,展示其在機器人操作、導航和視覺語言推理方面的統一能力。
2026-06
阿里巴巴正式發布Qwen-Robot具身智能模型系列,包含VLA操作、VLN導航和世界模型。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位