⚡雷峰网•較早收集於 2h
CVPR 2026:視頻模型從畫面生成轉向運動理解

💡探索 CVPR 2026 的新型視頻模型如何實現精確的運動控制與迭代自我優化。
⚡ 30-Second TL;DR
有什麼變化
MotionV2V 允許通過操作稀疏軌跡點來直接編輯視頻中的運動。
為什麼重要
這些技術為創作者與開發者提供了對視頻生成的細粒度控制,推動 AI 從「內容生成」走向「動態世界模擬」。
下一步行動
嘗試基於軌跡的視頻編輯模型,以便在生成式工作流中更好地控制角色與相機運動。
誰應關注:Creators & Designers
關鍵要點
- •MotionV2V 允許通過操作稀疏軌跡點來直接編輯視頻中的運動。
- •3D 點軌跡被用作統一表示,以提升複雜視頻編輯的一致性。
- •VISTA 引入推理階段自我優化智能體,通過迭代改寫提示詞來提升生成質量。
- •視頻模型正整合 3D 基礎模型先驗,以確保環繞視頻生成的幾何一致性。
🧠 深度解析
Web-grounded analysis with 15 cited sources.
🔑 增強重點摘要
- •MotionV2V 透過生成「運動反事實」(內容相同但運動模式不同的影片對)來訓練其運動條件影片擴散模型,實現精確且可控的影片運動編輯,並在使用者研究中表現出優於現有方法的真實感和可控性。
- •VISTA 採用多智能體系統,將使用者創意分解為時間規劃,透過成對影片競賽選出最佳結果,再由專家團隊評審視覺、音訊和上下文一致性,最終由推理智能體迭代改寫提示詞以自我優化生成品質。
- •影片生成模型正從單純的「外觀擬合」轉向「物理建模」,旨在解決現有模型在物理一致性方面的缺陷,例如物體運動、力傳遞和物理現象發生位置的精確理解,這對於實現真正的「世界模型」至關重要。
- •為確保影片生成中的幾何一致性,研究正探索顯式編碼幾何先驗(如對極幾何約束、三角測量原理)或聯合生成幾何一致的影片幀與隱式3D表示,以克服模型將影片視為2D圖像序列而非3D時空投影的局限。
🛠️ 技術深入
- MotionV2V 框架:
- 核心機制:影片到影片(video-to-video)框架,透過修改從輸入影片中提取的稀疏點軌跡來實現精確的運動編輯。
- 模型架構:基於運動條件的影片擴散模型,其骨幹建立在 CogVideoX-5B DiT(Denoising Transformers)文本到影片模型之上,並透過類似 ControlNet 的分支整合運動線索。
- 訓練策略:引入一種生成「運動反事實」(motion counterfactuals)的新穎管道,即內容相同但運動模式不同的影片對,用於微調運動條件擴散架構。
- 編輯能力:能夠控制物體出現的位置、移動速度和方向、出現時間,甚至攝影機位置,並支援迭代編輯,將前一次編輯的輸出作為下一次編輯的輸入。
- VISTA 框架:
- 系統類型:新穎的多智能體系統(Video Iterative Self-improving Agent),透過迭代循環中的提示詞優化自主提升影片生成品質。
- 工作流程:
- 初始化階段:將使用者創意分解為結構化的時間規劃,考慮場景時長、人物特徵、動作、對話、環境、攝影機角度、音效設計和整體氛圍等九個關鍵要素。
- 生成與選擇:生成多個影片版本,並透過穩健的成對競賽選出最佳影片,評估標準包括視覺真實度、物理常識性、文本與影片匹配度、音視訊同步性和觀眾參與度。
- 專家評審:由三位專家小組(專注於視覺、音訊和上下文保真度)對獲勝影片進行審查。
- 自我優化:推理智能體綜合這些回饋,內省式地重寫並增強提示詞,進入下一輪生成週期。
- 3D 基礎模型與幾何一致性:
- 挑戰:現有AI影片生成模型常將影片視為一系列2D圖像,缺乏對3D空間結構的理解,導致視角變化或長時間生成時出現物體扭曲、場景不連貫等幾何不一致問題。
- 解決方案:
- 「幾何強制」(Geometry Forcing):由專門訓練來理解3D幾何的基礎模型 VGGT(Visual Geometry Grounded Transformer)指導影片生成模型,透過角度對齊和尺度對齊來實現幾何一致性。
- FANTASYWORLD:引入統一的前饋架構,聯合生成幾何一致的影片幀和隱式3D表示,透過可訓練的幾何分支和雙向交叉注意力機制增強凍結的影片基礎模型。
- 顯式幾何先驗編碼:在 Transformer 架構中引入對極幾何約束、三角測量原理和投影一致性損失,強制模型遵循物理幾何規律。
- ProPhy 框架:一種漸進式物理對齊框架,使影片擴散模型具備「分層物理理解」與「空間物理對齊」能力,能夠判斷並精確定位物理現象應發生的位置。
🔮 前景展望AI analysis grounded in cited sources
影片生成模型將更深入地整合物理定律與3D幾何理解,從而實現更精確、更符合現實世界的動態模擬。
目前模型仍停留在「外觀擬合」,但CVPR 2026趨勢顯示對「物理建模」和「幾何一致性」的重視,將推動模型從模仿走向真正的理解與模擬。
影片生成將從單純的內容創作工具演變為具備自我優化與決策能力的智能系統,尤其在機器人與具身智能領域扮演核心角色。
VISTA等推理階段自我優化智能體的出現,以及影片模型作為「世界模型」在機器人控制中對動作可控性和物理一致性的需求,預示著其將超越被動生成,具備更主動的智能。
影片編輯將實現前所未有的精細化控制,使用者能透過直觀介面精確操縱影片中的複雜運動與時空元素。
MotionV2V透過稀疏軌跡點編輯運動的能力,以及對物體出現、速度、方向、時間和攝影機位置的全面控制,顯示影片編輯正朝向更精確、更直觀的方向發展。
⏳ 時間線
2020-00
NeRF (Neural Radiance Fields) 推出,開創了利用深度網路進行3D重建的新研究方向,推動了計算機視覺與圖形學的融合。
2024-02
OpenAI Sora 發布,展示了生成式AI影片在視覺逼真度、長時序一致性和物理世界理解方面的巨大潛力,引發全球關注。
2025-07
微软研究院與清華大學提出「幾何強制」(Geometry Forcing)方法,透過專門的幾何理解模型指導生成模型,解決AI影片生成中的空間一致性問題。
2025-10
VISTA (Video Iterative Self-improving Agent) 論文發表,提出透過迭代提示詞優化自主提升影片生成品質的多智能體系統。
2025-11
MotionV2V 論文首次發表,提出透過編輯稀疏軌跡點來精確控制影片運動,實現影片內容在時空上的操作。
2026-03
ProPhy 論文被CVPR 2026接收,提出漸進式物理對齊框架,使影片擴散模型具備「分層物理理解」與「空間物理對齊」能力,從「視覺逼真」邁向「物理一致」。
📎 來源 (15)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 雷峰网 ↗
