來源近期收集於 3h

Figure 宣稱找到機器人 Scaling Law

閱讀原文: 极客公园
#humanoid-robots#generalization#imitation-learning

Figure 的 30 戶測試挑戰機器人學習是否真的能超越展示場景泛化。

30 秒速覽

有什麼變化

Helix 2.5 在 30 個家庭執行任務,未使用針對家庭收集的機器人資料或微調。

為什麼重要

這項測試嘗試在受控展示之外衡量家庭環境泛化能力,具有重要意義,但 56% 的成功率仍不足以支援可靠的家用部署。這場爭論也顯示,機器人 scaling law 主張需要標準化且經獨立驗證的評估。

下一步行動

使用保留的房屋、物品與光線條件重現該評估設計,並報告各任務失敗率,而不只公布總體成功率。

誰應關注:Researchers & Academics

關鍵要點

  • •Helix 2.5 在 30 個家庭執行任務,未使用針對家庭收集的機器人資料或微調。
  • •評估涵蓋整理玩具、折疊毛巾與鋪床。
  • •據報 56% 的任務成功率引發機器人業界競爭者批評。
關鍵數字1,600 萬1,500 萬56%9%

深度解析

背景與延伸:來自公開資料,非原文內容。引用 14 個來源。

增強重點摘要

  • •Figure 宣稱發現「人類到人形機器人遷移 Scaling Law」,顯示在下游適應固定的情況下,人類行為預訓練數據每翻倍一次,動作預測損失便呈現可預測的下降趨勢。
  • •Helix 2.5 依賴眾包影音平台「Index」進行預訓練,該生態系已累積超過 1,600 萬支家庭任務影片,每秒吸收約 35 分鐘的日常人類動作素材,累計發放超過 1,500 萬美元報酬。
  • •Helix 2.5 在零樣本環境下的 56% 成功率,相較於未導入人類影音預訓練模型僅 9% 的成功率帶來約 6 倍的性能躍升,且各測試任務在預訓練數據庫中的佔比均不超過 1.90%。
  • •相較前代 Helix 02,Helix 2.5 所需的特定任務微調數據量減少了 50%,同時將零樣本未建模物理環境的部署適應力拓展了 30 倍。
  • •為支撐 Scaling Law 所需算力,Figure 與雲端業者 Nscale 簽署多年協議,初期承諾斥資 35 億美元以取得多達 10 萬顆 Nvidia GPU(瞄準 Vera Rubin 架構路線圖)。

競品分析

核心架構與訓練來源
Figure AI (Helix 2.5)
具身基礎模型,藉由 Index 平台大規模人類影片預訓練進行跨域遷移
Sunday Robotics (ACT-2)
基於模仿學習與強化學習之動作控制系統(ACT 系列進階版)
傳統遠程操作與模仿學習架構
高依賴機器人遠程遙操作軌跡數據與特定場景微調
泛化能力測試場景
Figure AI (Helix 2.5)
30 個舊金山灣區完全陌生家庭之 Zero-shot 部署
Sunday Robotics (ACT-2)
結構化或受限特定任務環境
傳統遠程操作與模仿學習架構
固定實驗室、工廠流水線或經過預先建圖之環境
任務基準測試表現
Figure AI (Helix 2.5)
未微調家庭任務整體成功率 56%(涵蓋折毛巾、鋪床、收玩具)
Sunday Robotics (ACT-2)
衣物操作等專用任務成功率達 99.1%
傳統遠程操作與模仿學習架構
專門任務高精度(>90%),但遇到環境擾動與未見場景泛化率驟降
產業爭議與限制
Figure AI (Helix 2.5)
44% 失敗率在家庭環境中潛藏安全與易碎品損壞風險
Sunday Robotics (ACT-2)
泛化範圍相對受限於特定動作類別,缺乏跨多場景之通用性
傳統遠程操作與模仿學習架構
缺乏從人類影片提取因果關係能力,無法自主從因果失敗中復原

技術深入

  • 架構與遷移機制:Helix 2.5 為具身 AI 基礎模型(Embodiment Foundation Model),其核心為「Human-to-Humanoid Transfer Scaling Law」,藉由高達 8 倍規模的人類日常影片預訓練,使模型直接學會家庭動作先驗,在不進行目標環境微調下將動作預測損失降至極低。
  • Index 數據管線:預訓練依賴開放式眾包採集平台 Index,以手機應用程式即時回傳第一人稱與第三人稱視角之日常家務影像。數據庫已收錄逾 1,600 萬段影片,並以每秒 35 分鐘新影片的吞吐量持續擴充,且無單一評估任務在預訓練集中權重超過 1.90%,確保泛化評估之客觀性。
  • 微調數據與部署效率:與 Helix 02 相比,Helix 2.5 執行新型下游任務時所需的特定示範數據量減少 50%,並能以 Zero-shot 方式直接適應未事先建立 3D 幾何地圖的物理空間,將部署適用性提升達 30 倍。
  • 算力集群規模:與雲端供應商 Nscale 合作佈署運算設施,初期投入 35 億美元,鎖定達 100,000 顆 Nvidia 次世代 Vera Rubin 架構 GPU,為具身多模態大模型的持續擴展提供算力支撐。

前景展望基於引用來源的 AI 分析

具身智慧研發主流將從機器人遙操作數據全面轉向海量人類第一人稱影片預訓練
Figure 證明藉由人類影片預訓練能使未微調任務成功率提升 6 倍並減少 50% 專用示範數據,大幅降低以往依賴昂貴遙操作設備採集數據的瓶頸。
56% 的零樣本成功率將使消費級人形機器人短期內無法直接商用落地於一般家庭
家用環境對安全容錯率極低,44% 的任務失敗率容易導致易碎品損壞或人員受傷,顯示純模仿學習仍缺乏動態因果修正與嚴格可靠性。

時間線

2026-08
Figure AI 正式公開大規模眾包數據採集平台 Index
2026-09
Figure 發表具身基礎模型 Helix 2.5 並公布在 30 個真實家庭之 56% 成功率測試數據
2026-09
Figure 與 Nscale 達成 35 億美元算力協議並引發具身 Scaling Law 業界辯論

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 极客公园 ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。