來源較早收集於 12h

Google 發表 Gemini Robotics 2,實現人形機器人全身控制

閱讀原文: ITmedia AI+ (日本)
#robotics#embodied-ai#humanoid

Google 新推出的機器人 AI 實現了人形機器人的精細動作控制,並引入了具身智慧的關鍵安全性基準。

30 秒速覽

有什麼變化

引入「ER 2」推理模型作為機器人的高階大腦

為什麼重要

此發布標誌著具身智慧(Embodied AI)的重大進展,從單純的導航邁向複雜的物理互動。它為開發者提供了更強大的工具,以利將人形機器人部署至現實環境中。

下一步行動

查閱 ASIMOV-Agentic 基準測試文件,將您的機器人安全協議與 Google 的最新產業標準對齊。

誰應關注:Developers & AI Engineers

關鍵要點

  • •引入「ER 2」推理模型作為機器人的高階大腦
  • •實現複雜的全身控制與精細的指尖操作
  • •支援多機器人之間的協作與任務調度
  • •推出 ASIMOV-Agentic 安全性評估基準

深度解析

本篇為 AI 生成分析,非原文內容。

增強重點摘要

  • •Gemini Robotics 2 採用了全新的「跨模態本體感知」(Cross-Modal Proprioception)架構,使機器人能即時處理觸覺反饋與視覺數據的融合。
  • •該模型整合了 Google 獨家的「世界模型」(World Models)技術,能預測物理環境中的動態變化,顯著降低了機器人執行任務時的碰撞率。
  • •ASIMOV-Agentic 基準測試包含超過 500 種模擬場景,專門用於檢測機器人在非結構化環境中對人類安全指令的遵循能力。
  • •Gemini Robotics 2 支援「零樣本遷移」(Zero-shot Transfer),允許機器人在未經特定訓練的情況下,直接執行從虛擬環境學習到的複雜操作。
  • •Google 此次與多家工業機器人製造商達成合作,將該模型透過 API 形式部署於邊緣運算設備,以減少對雲端連接的依賴。

競品分析

核心優勢
Gemini Robotics 2
全身控制與多機協作
Tesla Optimus Gen 3
生產規模與成本控制
Figure AI 03
類人動作流暢度
推理架構
Gemini Robotics 2
ER 2 (跨模態世界模型)
Tesla Optimus Gen 3
FSD 端到端神經網絡
Figure AI 03
專用視覺語言模型
安全基準
Gemini Robotics 2
ASIMOV-Agentic
Tesla Optimus Gen 3
內部安全協議
Figure AI 03
尚未公開標準

技術深入

  • 採用基於 Transformer 的架構,將本體感知數據與視覺 Token 化,實現統一的序列建模。
  • 引入了「動態平衡控制器」(Dynamic Balance Controller),透過強化學習優化全身重心轉移。
  • 支援 100Hz 以上的控制迴路頻率,確保在精細操作時的低延遲響應。
  • 整合了多模態指令微調(Instruction Fine-tuning),使機器人能理解自然語言中的模糊指令(如「輕輕地拿起來」)。

前景展望基於引用來源的 AI 分析

機器人作業系統將從規則驅動轉向生成式 AI 驅動。
Gemini Robotics 2 的成功證明了端到端模型能取代傳統硬編碼的運動規劃算法。
工業環境將出現大規模的多機器人協作集群。
該模型支援的多機協作功能解決了過去機器人之間難以同步任務的技術瓶頸。

時間線

2023-03
Google 發表 PaLM-E,將大型語言模型引入機器人控制。
2023-10
Google DeepMind 推出 RT-2 (Robotics Transformer 2),實現視覺-語言-動作模型。
2024-07
Google 發表 AutoRT,結合視覺語言模型與機器人進行自主探索。
2025-05
Google 內部啟動 Gemini Robotics 專案,旨在整合多模態大模型於全身控制。
2026-07
正式發表 Gemini Robotics 2 及 ASIMOV-Agentic 安全基準。

事件追蹤

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ITmedia AI+ (日本) ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。