🔥36氪•較早收集於 11m
浙江人形聯合香港中文大學提出RAM三維空間理解與操作模型
💡RAM實現機器人3D操作89%成功率–VLM具身AI突破(22字)
⚡ 30-Second TL;DR
有什麼變化
RAM解決VLM三維空間感知短板
為什麼重要
推進具身AI於人形機器人,提升真實世界任務執行能力。促進VLM於機器人整合,可能加速商業部署。
下一步行動
在您的人形機器人模擬器上測試RAM與Qwen-VL整合。
誰應關注:Researchers & Academics
關鍵要點
- •RAM解決VLM三維空間感知短板
- •檢索增強外部三維知識庫
- •語言驅動機器人任務成功率89.17%
- •圖像引導操作成功率92%
- •適配GPT、Qwen-VL及人形機器人平台
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •RAM模型採用了創新的「檢索增強生成」(RAG)架構,將大規模三維場景知識庫與視覺語言模型(VLM)解耦,顯著降低了模型對特定環境訓練數據的依賴。
- •該研究解決了機器人在複雜動態環境中,因視覺遮擋或光照變化導致的物體位姿估計不穩定問題,提升了機器人在非結構化空間的泛化能力。
- •RAM模型不僅支援主流的GPT與Qwen-VL系列,還特別針對人形機器人的運動控制接口進行了優化,實現了從高層語義規劃到低層運動控制的端到端對齊。
📊 競品分析▸ Show
| 特性 | RAM (浙江人形/港中大) | Google RT-2 | NVIDIA VIMA |
|---|---|---|---|
| 核心機制 | 三維知識庫檢索增強 | 視覺-語言-動作端到端 | 多模態提示工程 |
| 空間感知 | 強(顯式三維幾何) | 中(隱式特徵) | 中(基於注意力) |
| 任務規劃 | 長程任務規劃 | 短程指令執行 | 複雜任務序列 |
| 基準測試 | 89.17% (語言指令) | 約 70-80% (視場景) | 約 75-85% (視場景) |
🛠️ 技術深入
- 架構設計:採用雙流網絡結構,一條分支處理二維視覺特徵,另一條分支通過檢索模塊從外部三維知識庫提取幾何與語義信息。
- 位姿估計:引入了基於幾何約束的位姿優化層,將VLM輸出的語義標籤映射到精確的三維坐標系中。
- 長程規劃:利用層次化任務分解算法,將複雜指令拆解為可執行的原子動作序列,並通過反饋循環進行動態調整。
- 適配性:模型接口兼容ROS 2(Robot Operating System),支持多種主流人形機器人硬件平台的直接部署。
🔮 前景展望AI analysis grounded in cited sources
人形機器人將在2027年前實現家庭場景的自主導航與基礎操作。
RAM模型解決了三維空間感知這一核心瓶頸,使得機器人能更準確地理解家庭環境中的物體位置與操作邏輯。
基於檢索增強的三維感知將成為下一代具身智能模型的標準配置。
該方法有效解決了單純依賴模型參數存儲空間知識的局限性,提供了更具擴展性的解決方案。
⏳ 時間線
2024-06
浙江人形機器人創新中心正式成立,聚焦具身智能與人形機器人核心技術。
2025-11
研究團隊完成RAM模型初步架構設計,並在模擬環境中驗證了三維檢索機制。
2026-04
RAM模型研究成果正式發表於《Science Robotics》,標誌著該技術獲得國際學術界認可。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪 ↗
