🤗Hugging Face Blog•較早收集於 0m
微調 NVIDIA Cosmos Predict 2.5 進行機器人影片生成
💡學習如何使用高效的 LoRA/DoRA 微調技術,將 NVIDIA 最新的影片模型應用於機器人領域。
⚡ 30-Second TL;DR
有什麼變化
利用 LoRA 與 DoRA 進行 Cosmos Predict 2.5 的參數高效微調。
為什麼重要
使開發人員能夠利用先進的影片生成模型,建立專門的機器人訓練數據與模擬。這顯著降低了在合成環境中訓練具身智慧代理的門檻。
下一步行動
複製 Hugging Face 儲存庫並在您自己的機器人數據集上執行提供的微調腳本,以測試領域適應性。
誰應關注:Developers & AI Engineers
關鍵要點
- •利用 LoRA 與 DoRA 進行 Cosmos Predict 2.5 的參數高效微調。
- •針對機器人領域的影片生成工作流程進行優化。
- •提供將大型影片模型應用於特定領域的實作指南。
🧠 深度解析
Web-grounded analysis with 20 cited sources.
🔑 增強重點摘要
- •NVIDIA Cosmos Predict 2.5 是 NVIDIA 世界基礎模型 (WFM) 系列的最新版本,專門用於以影片形式模擬和預測世界的未來狀態,並將 Text2World、Image2World 和 Video2World 功能整合到單一模型中。
- •該模型利用 Cosmos-Reason1(一種物理 AI 推理視覺語言模型 VLM)作為其文本編碼器,使其能夠對物理合理性進行推理,從而生成符合現實世界物理定律的影片。
- •Cosmos Predict 2.5 提供 2B 和 14B 兩種模型尺寸,相較於其前身 Cosmos-Predict1,在品質和提示對齊方面有顯著改進,同時體積縮小了 3.5 倍,提高了效率。
- •DoRA (Weight-Decomposed Low-Rank Adaptation) 是一種改進 LoRA 的微調方法,透過將預訓練權重分解為幅度和方向分量並同時進行微調,在多種任務中持續優於 LoRA,且不增加額外的推理開銷。
🛠️ 技術深入
- 模型架構: Cosmos-Predict2.5 是一個基於擴散變壓器 (diffusion transformer) 的模型,專為潛在空間中的影片去噪而設計。
- 核心組件: 網路由交錯的自注意力 (self-attention)、交叉注意力 (cross-attention) 和前饋層 (feedforward layers) 組成。
- 文本條件化: 交叉注意力層允許模型在去噪過程中以輸入文本為條件。
- 時間資訊嵌入: 在每個層之前,應用自適應層歸一化 (adaptive layer normalization) 以嵌入時間資訊進行去噪。
- 統一功能: 它將 Text2World、Image2World 和 Video2World 統一為一個單一的流式模型。
- 文本編碼器: 使用 Cosmos-Reason1,一個物理 AI 推理視覺語言模型 (VLM),作為其文本編碼器,以實現物理合理性推理。
- 訓練數據: 模型在 2 億個高品質精選影片片段上進行訓練,並透過基於強化學習的後訓練進行優化。
- DoRA 機制: DoRA 透過將預訓練權重分解為幅度和方向分量來改進 LoRA,並對兩者進行微調,從而實現更靈活的更新和更好的學習能力,且訓練後可將分解的組件合併回預訓練權重,不產生額外推理開銷。
🔮 前景展望AI analysis grounded in cited sources
機器人行為泛化能力將大幅提升
透過微調世界模型生成合成機器人數據,機器人將能學習並執行更多樣化的任務,包括零樣本行為泛化和環境泛化。
物理AI系統的開發週期將顯著縮短
Cosmos Predict 2.5 及其相關的世界基礎模型平台,透過高擬真模擬和合成數據生成,加速了機器人與自動駕駛系統的訓練、測試與部署。
AI模型將更深入理解物理世界
結合 Cosmos-Reason1 作為文本編碼器,Cosmos Predict 2.5 能理解物理世界的合理性,生成符合物理定律的影片,這將推動 AI 在物理推理方面的進步。
⏳ 時間線
2024-06
NVIDIA Research 開發並發表 DoRA,一種改進 LoRA 的參數高效微調方法。
2025-08
NVIDIA 推出新的 Omniverse 函式庫和 Cosmos 世界基礎模型 (WFMs),加速機器人解決方案的開發和部署。
2025-09
NVIDIA 在 CoRL 2025 上宣布 Cosmos Predict 2.5,將 Text2World、Image2World 和 Video2World 合併為單一模型,並支援長達 30 秒的影片生成和多視角輸出。
2025-10
Cosmos-Predict2.5-2B 和 Cosmos-Predict2.5-14B 模型在 Hugging Face 上發布,提供 NVIDIA Open Model License。
2026-01
NVIDIA 發布新的 Cosmos 和 GR00T 開放模型和數據,用於機器人學習和推理,並將 Isaac 開放模型和函式庫整合到 LeRobot 中。
2026-02
NVIDIA 引入 Cosmos Policy,利用 Cosmos Predict-2 世界基礎模型進行機器人操作任務的後訓練。
📎 來源 (20)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Hugging Face Blog ↗