🔥較早收集於 6m

騰訊混元開源世界模型RL後訓練框架WorldCompass

PostLinkedIn
🔥閱讀原文: 36氪

💡首個世界模型RL工具:立即強化您的3D模擬與機器人訓練管線!(28字元)

⚡ 30-Second TL;DR

有什麼變化

全球首個世界模型RL後訓練開源框架

為什麼重要

加速機器人、模擬與3D AI應用的世界模型開發,提供即用RL訓練工具。

下一步行動

複製WorldCompass儲存庫,在您的世界模型上測試RL微調以提升指令遵循。

誰應關注:Researchers & Academics

關鍵要點

  • 全球首個世界模型RL後訓練開源框架
  • 騰訊混元3D團隊開發
  • 引導模型遵循用戶指令探索
  • 維持長時序視覺一致性
  • 適用長時序互動世界模型

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • WorldCompass引入三項核心創新:片段級展開策略(clip-level rollout)、互補獎勵函數(interaction-following accuracy與visual quality),以及負向感知微調策略(negative-aware fine-tuning)。[1]
  • 該框架應用於WorldPlay-8B模型(基於HY Video),顯著提升不同持續時間與動作複雜度的互動準確性與視覺保真度。[1][3]
  • 論文於2026年2月發布於arXiv,並提供專案頁面與線上演示。[1]

🛠️ 技術深入

  • 片段級展開策略:在單一目標片段生成並評估多個樣本,提升長時序自迴歸視頻生成的展開效率並提供細粒度獎勵訊號。[1]
  • 互補獎勵函數:設計交互遵循準確度與視覺品質獎勵,直接監督並抑制獎勵駭客行為。[1]
  • 高效RL演算法:採用負向感知微調策略,結合多項效率優化,提升模型容量。[1]
  • 評估:在WorldPlay(Sun et al., 2025)上進行後訓練,涵蓋短長期持續時間與基本/複合動作情境。[1]

🔮 前景展望AI analysis grounded in cited sources

WorldCompass將加速開源世界模型的互動應用開發
作為首個針對長時序互動視頻世界模型的RL後訓練框架,其開源性與在WorldPlay上的驗證結果可供開發者廣泛應用於遊戲與模擬。[1][3]
提升騰訊Hunyuan生態在3D與視頻生成領域的競爭力
WorldCompass建基於HY Video與Hunyuan 3D系列,結合騰訊超過30個開源模型的累積,將強化其在全球開源AI領導地位。[3][4]

時間線

2026-01
發布WorldPlay-8B模型訓練代碼(基於HY Video)
2026-02
WorldCompass論文發布於arXiv
2026-03-08
騰訊混元3D團隊開源WorldCompass框架
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。