🏕️极客公园•最新收集於 46m
GEN-1.5 為機器人帶來類似 GPT-3 的智能湧現
#embodied-ai#robot-learning#few-shot-learning#scaling-lawsgen-1.5generalistgen-1.5gpt-3physical-prompting
💡GEN-1.5 只看一次短示範就能嘗試新任務,可能成為具身 AI 的重要轉折點。
⚡ 30-Second TL;DR
有什麼變化
GEN-1.5 能針對未見過的工具、障礙與物體狀態推理替代策略,而非重播固定軌跡。
為什麼重要
如果這些結果能在示範之外的場景中泛化,物理提示可能大幅降低機器人部署新任務的成本與延遲。不過,單次提示 59% 的成功率仍低於無人值守商業運作所需的可靠性。
下一步行動
建立包含 10 項任務的物理提示基準,先比較單次推理與 1 至 10 次更新適應的效果,再投入特定任務的機器人微調。
誰應關注:Researchers & Academics
關鍵要點
- •GEN-1.5 能針對未見過的工具、障礙與物體狀態推理替代策略,而非重播固定軌跡。
- •「物理提示」讓機器人觀看一次短示範後,無需微調即可立即嘗試新任務。
- •模型可將兩個或多個示範組合成更長的動作序列,並自行補足重新定位、換手與重新抓取。
- •據稱,訓練需求已從數百次梯度更新降至可直接嘗試任務的零次更新。
- •模型呈現出依靠更多真實世界資料、更大模型與更多算力持續擴展的趨勢。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 11 個來源。
🔑 增強重點摘要
- •GEN-1.5 的核心能力源於長達八個月的大規模物理交互數據預訓練,而非透過元學習或輔助目標進行顯式工程設計。
- •該模型具備零樣本模擬到真實(Sim-to-Real)的遷移能力,允許在模擬環境中錄製的示範直接指導現實世界的機器人執行任務。
- •GEN-1.5 展現了高度的即興創作能力,例如能識別並使用香蕉作為臨時刷子,顯示其具備超越單純模仿的推理邏輯。
- •Generalist AI 公司由 Google DeepMind 與 Boston Dynamics 前員工創立,並於 2026 年 6 月完成 4 億美元融資,估值達到 20 億美元。
- •該模型在處理多模態輸入(影片、感測器、語言、本體感覺)時,能以 100 Hz 的高頻率輸出動作軌跡。
📊 競品分析▸ Show
| 特性 | GEN-1.5 | Google RT-2 | Tesla Optimus (FSD-based) |
|---|---|---|---|
| 學習方式 | 物理提示 (In-context) | 視覺-語言-動作微調 | 端到端神經網絡 |
| 零樣本能力 | 高 (具備推理與即興) | 中 (依賴預訓練數據) | 低 (依賴特定任務訓練) |
| 動作頻率 | 100 Hz | 較低 | 未公開 |
🛠️ 技術深入
- 模型架構:大型多模態模型 (LMM),整合視覺、感測器、語言與本體感覺數據。
- 動作輸出:支援 100 Hz 的高頻率動作軌跡生成,確保機器人操作的流暢性。
- 上下文窗口:具備 30 秒的上下文窗口,可容納 3 至 12 秒的感測器運動示範。
- 訓練機制:透過持續八個月的大規模物理交互數據預訓練,實現湧現式行為。
- 數據效率:支援在 5 分鐘的任務數據下,透過 10 次梯度更新將成功率從 59% 提升至 83%。
🔮 前景展望AI analysis grounded in cited sources
機器人數據收集將擺脫對遠端遙控(Teleoperation)的過度依賴。
GEN-1.5 的物理提示能力證明了模型可透過少量示範進行泛化,降低了對大規模人工標註數據的需求。
具身智能將進入「上下文學習」時代。
模型展示了類似 GPT-3 的湧現能力,意味著未來機器人無需針對每個新任務進行昂貴的微調。
⏳ 時間線
2025-12
Generalist AI 完成為期八個月的物理交互數據預訓練。
2026-06
Generalist AI 獲得 4 億美元融資,公司估值達到 20 億美元。
2026-08
正式發布 GEN-1.5,引入物理提示(Physical Prompting)技術。
📎 來源 (11)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 极客公园 ↗
每週 AI 簡報
每週一封,可隨時退訂。



