🐼較早收集於 83m

騰訊開源世界模型強化學習框架 WorldCompass

騰訊開源世界模型強化學習框架 WorldCompass
PostLinkedIn
🐼閱讀原文: Pandaily
#world-model#rl-frameworkworldcompasstencenthunyuanworldcompass

💡世界模型 RL 準確率提升 35%—建構可靠 AI 代理的關鍵。(28字元)

⚡ 30-Second TL;DR

有什麼變化

騰訊 Hunyuan 團隊開源

為什麼重要

WorldCompass 提升世界模型能力,讓 AI 代理更可靠地處理複雜任務,並促進 RL 研究的開放創新。

下一步行動

將 WorldCompass 整合至世界模型管線,提升 RL 動作準確率 35%。

誰應關注:Researchers & Academics

關鍵要點

  • 騰訊 Hunyuan 團隊開源
  • 世界模型的強化學習後訓練框架
  • 複雜動作執行準確率提升 35 個百分點

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • WorldCompass 引入剪輯級 rollout 策略,在單一目標剪輯生成多個樣本,提升 rollout 效率並提供細粒度獎勵信號。
  • 框架設計互補獎勵函數,同時監督互動遵循準確度和視覺品質,有效抑制獎勵駭客行為。
  • 應用於 WorldPlay 模型,在長視野和不同動作複雜度情境下顯著提升互動準確度和視覺保真度。
  • 支援連續+離散動作空間,結合即時延遲與長程一致性,適用第一人稱和第三人稱視角。

🛠️ 技術深入

  • 核心創新包括:1) 剪輯級 rollout 策略,在單一目標剪輯生成並評估多樣本,提高效率並提供細粒度獎勵;2) 互補獎勵函數,分別針對互動遵循準確度和視覺品質;3) 高效 RL 演算法,使用 negative-aware fine-tuning 策略結合效率優化提升模型容量。
  • 基於自迴歸視頻生成範式,模型 π_θ(x_n | x_{1:n-1}, a_n, c) 生成未來狀態,條件於歷史觀測、使用者動作和提示。
  • 評估於 WorldPlay (2025),改善短/長程持續時間及基本/複合動作的互動準確度和視覺品質。
  • WorldPlay 記憶機制:時間記憶(近期幀確保運動連續性)和空間記憶(基於 FOV 重疊和相機距離採樣非相鄰幀),使用時間重構重新分配位置編碼。

🔮 前景展望AI analysis grounded in cited sources

WorldCompass 將加速世界模型在遊戲和模擬應用中的商業部署
其提升複雜動作準確率 35 個百分點並維持長序列視覺一致性,解決長視野互動瓶頸。
開源將促進社區對 RL 後訓練框架的改進和基準測試
基於 arXiv 論文和 GitHub 釋出,提供完整代碼和 WorldPlay 評估基準。

時間線

2025-12
釋出 HY-World 1.5 (WorldPlay) 技術報告和研究論文
2025
發表 WorldPlay 論文,聚焦長程幾何一致性即時互動世界建模
2025
發表 WorldCompass 論文,介紹長視野世界模型 RL 框架
2026-03
騰訊 Hunyuan 團隊開源 WorldCompass 框架
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。