浙江人形聯合香港中文大學提出RAM三維空間理解與操作模型
浙江人形機器人創新中心、香港中文大學與浙江大學在《Science Robotics》發表RAM模型,破解視覺語言大模型三維空間感知短板。透過檢索增強外部三維知識庫,實現物體位姿理解與長程任務規劃。語言指令操作平均成功率89.17%,圖像引導操作成功率92%。
Tag: #3d-perception5 results
浙江人形機器人創新中心、香港中文大學與浙江大學在《Science Robotics》發表RAM模型,破解視覺語言大模型三維空間感知短板。透過檢索增強外部三維知識庫,實現物體位姿理解與長程任務規劃。語言指令操作平均成功率89.17%,圖像引導操作成功率92%。

ORBBEC 正從其核心的機器人視覺業務轉型,探索包括實體 AI 與 3D 列印在內的高成長領域。此次策略性擴張利用了他們在 3D 感知方面的專業知識,以搶佔新的工業市場。
港科廣陳昶昊的 LegoOcc 從單張 RGB 影像預測開放詞彙 3D 占用,無需 3D 語義標註,獲 CVPR 2026 口頭報告。於 Occ-ScanNet 達 59.50 IoU/21.05 mIoU,超越開放詞彙基線。讓機器人透過自然語言查詢空間。

文章認為,Physical AI 在自動駕駛、機器人與製造業的擴張,將使 LiDAR 成為主要受益者。Hesai 在 ADAS 出貨量上持續領先且毛利率較高,而 RoboSense 則在機器人與成本敏感型應用中快速成長。

由 Visincept、清華大學及 IDEA 開發的 SpatialPoint 框架,將深度資料作為視覺語言模型 (VLM) 的核心輸入。此進展讓機器人能產生精準 3D 座標。適用於需空間精度的複雜機器人任務。