🔥較早收集於 11m

浙江人形聯合香港中文大學提出RAM三維空間理解與操作模型

浙江人形聯合香港中文大學提出RAM三維空間理解與操作模型
PostLinkedIn
🔥閱讀原文: 36氪

💡RAM實現機器人3D操作89%成功率–VLM具身AI突破(22字)

⚡ 30-Second TL;DR

有什麼變化

RAM解決VLM三維空間感知短板

為什麼重要

推進具身AI於人形機器人,提升真實世界任務執行能力。促進VLM於機器人整合,可能加速商業部署。

下一步行動

在您的人形機器人模擬器上測試RAM與Qwen-VL整合。

誰應關注:Researchers & Academics

關鍵要點

  • RAM解決VLM三維空間感知短板
  • 檢索增強外部三維知識庫
  • 語言驅動機器人任務成功率89.17%
  • 圖像引導操作成功率92%
  • 適配GPT、Qwen-VL及人形機器人平台

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • RAM模型採用了創新的「檢索增強生成」(RAG)架構,將大規模三維場景知識庫與視覺語言模型(VLM)解耦,顯著降低了模型對特定環境訓練數據的依賴。
  • 該研究解決了機器人在複雜動態環境中,因視覺遮擋或光照變化導致的物體位姿估計不穩定問題,提升了機器人在非結構化空間的泛化能力。
  • RAM模型不僅支援主流的GPT與Qwen-VL系列,還特別針對人形機器人的運動控制接口進行了優化,實現了從高層語義規劃到低層運動控制的端到端對齊。
📊 競品分析▸ Show
特性RAM (浙江人形/港中大)Google RT-2NVIDIA VIMA
核心機制三維知識庫檢索增強視覺-語言-動作端到端多模態提示工程
空間感知強(顯式三維幾何)中(隱式特徵)中(基於注意力)
任務規劃長程任務規劃短程指令執行複雜任務序列
基準測試89.17% (語言指令)約 70-80% (視場景)約 75-85% (視場景)

🛠️ 技術深入

  • 架構設計:採用雙流網絡結構,一條分支處理二維視覺特徵,另一條分支通過檢索模塊從外部三維知識庫提取幾何與語義信息。
  • 位姿估計:引入了基於幾何約束的位姿優化層,將VLM輸出的語義標籤映射到精確的三維坐標系中。
  • 長程規劃:利用層次化任務分解算法,將複雜指令拆解為可執行的原子動作序列,並通過反饋循環進行動態調整。
  • 適配性:模型接口兼容ROS 2(Robot Operating System),支持多種主流人形機器人硬件平台的直接部署。

🔮 前景展望AI analysis grounded in cited sources

人形機器人將在2027年前實現家庭場景的自主導航與基礎操作。
RAM模型解決了三維空間感知這一核心瓶頸,使得機器人能更準確地理解家庭環境中的物體位置與操作邏輯。
基於檢索增強的三維感知將成為下一代具身智能模型的標準配置。
該方法有效解決了單純依賴模型參數存儲空間知識的局限性,提供了更具擴展性的解決方案。

時間線

2024-06
浙江人形機器人創新中心正式成立,聚焦具身智能與人形機器人核心技術。
2025-11
研究團隊完成RAM模型初步架構設計,並在模擬環境中驗證了三維檢索機制。
2026-04
RAM模型研究成果正式發表於《Science Robotics》,標誌著該技術獲得國際學術界認可。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪