🐯虎嗅•最新收集於 16m
Harness VLA 推動模型與系統協同

💡Harness VLA 展示任務編排如何讓具身模型比純端到端控制更可靠。
⚡ 30-Second TL;DR
有什麼變化
Harness VLA 將精細操作與長程規劃、導航、目標搜尋及失敗恢復分離處理。
為什麼重要
如果成效可靠,模型加系統的協同範式可能在不依賴單一超大型端到端策略的情況下,提升多步驟機器人工作流程的可靠性。這也顯示具身 AI 的進展不只取決於更大的基礎模型,還需要可擴展的真實世界資料收集與編排基礎設施。
下一步行動
請將你的 VLA 模型與程式碼式任務規劃器配對,建立雙層機器人策略,並分別記錄操作、導航與恢復能力的評測指標。
誰應關注:Researchers & Academics
關鍵要點
- •Harness VLA 將精細操作與長程規劃、導航、目標搜尋及失敗恢復分離處理。
- •Harness Layer 與 code policy agent 讓系統學習如何分配子任務,而不是迫使單一 VLA 模型處理所有工作。
- •于超認為強化學習的核心作用,是生成互動資料,並學習重力、摩擦力、質量等物理特性。
- •她提出的具身 AI Scaling Law,不只擴大模型與資料規模,也要擴大機器人本體數量。
- •文章同時介紹 RLinf 框架與 MAPPO 演算法,作為其具身及多智能體強化學習研究成果。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Harness VLA 的研究背景源於清華大學交叉信息研究院(IIIS),于超團隊旨在解決端到端 VLA 模型在處理長序列任務時容易出現的『災難性遺忘』與規劃能力不足問題。
- •該架構引入了層次化決策機制,Harness Layer 充當系統的『大腦』,負責將複雜指令拆解為可執行的原子動作序列,並動態監控執行狀態。
- •Code Policy Agent 的核心優勢在於其可解釋性,相比於黑盒神經網路,代碼形式的策略更容易進行人工干預、除錯與邏輯驗證。
- •在具身 AI Scaling Law 的觀點中,于超強調了『機器人多樣性(Robot Diversity)』的重要性,認為增加機器人本體的形態與硬體規格,比單純增加模型參數更能提升泛化能力。
- •RLinf 框架特別針對真實世界環境中的稀疏獎勵(Sparse Reward)問題進行了優化,透過引入自動化互動資料採集機制,顯著降低了對人類示範資料的依賴。
📊 競品分析▸ Show
| 特性 | Harness VLA | Google RT-2 | Stanford ALOHA |
|---|---|---|---|
| 核心架構 | 模型與系統協同 (Harness Layer) | 端到端 VLA | 模仿學習 (Imitation Learning) |
| 規劃能力 | 強 (Code Policy Agent) | 中 (依賴模型推理) | 弱 (依賴示範) |
| 物理學習 | 強化學習驅動 | 數據驅動 (預訓練) | 數據驅動 (示範) |
| 適用場景 | 長程複雜任務 | 短程精細操作 | 桌面級精細操作 |
🛠️ 技術深入
- Harness Layer:作為中間件層,負責協調視覺感知模型與底層控制策略,透過狀態機邏輯處理任務切換。
- Code Policy Agent:利用大型語言模型(LLM)生成 Python 腳本作為機器人控制策略,實現邏輯與動作的解耦。
- RLinf 框架:採用多智能體強化學習(MAPPO)演算法,在模擬環境中進行大規模並行訓練,並透過 Sim-to-Real 技術遷移至實體機器人。
- 物理特性建模:透過在強化學習訓練循環中加入重力與摩擦力擾動,使模型具備對環境物理屬性的隱式感知能力。
🔮 前景展望AI analysis grounded in cited sources
具身 AI 將從端到端模型轉向模組化系統架構
單一模型難以同時兼顧長程規劃與精細操作,系統協同架構能有效提升任務成功率與可維護性。
機器人硬體多樣性將成為 Scaling Law 的關鍵指標
研究顯示跨硬體平台的訓練能顯著提升模型對不同物理環境的適應力,推動具身智慧的泛化。
⏳ 時間線
2024-05
于超團隊發表關於具身智能與多智能體強化學習的初步研究成果
2025-02
RLinf 框架正式提出,旨在解決具身 AI 在真實世界中的互動學習效率問題
2026-03
Harness VLA 架構發布,提出模型與系統協同的新範式
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗



