⚛️量子位•較早收集於 63m
字節跳動開源 Bernini 框架,賦能 AI 影片編輯

💡字節跳動推出的全新開源框架,透過為 DiT 模型配備「大模型軍師」,實現更聰明的 AI 影片編輯。
⚡ 30-Second TL;DR
有什麼變化
為 DiT 模型引入「大模型軍師」架構。
為什麼重要
此框架透過增加推理層,有望顯著降低 AI 影片生成中的「幻覺」或意圖偏差,標誌著影片生產工具正朝向更可控、更具語意理解力的方向發展。
下一步行動
查看 Bernini 的 GitHub 儲存庫,評估其編排層如何整合進您現有的影片生成工作流中。
誰應關注:Developers & AI Engineers
關鍵要點
- •為 DiT 模型引入「大模型軍師」架構。
- •專注於提升 AI 影片編輯任務的語意理解能力。
- •透過開源促進影片生成工作流的社群發展。
🧠 深度解析
Web-grounded analysis with 10 cited sources.
🔑 增強重點摘要
- •Bernini 是一個統一的影片理解、生成與編輯框架,旨在解決模型難以理解創作者意圖的問題,透過先理解再動手的方式提升編輯精準度。
- •此框架採用「語義規劃 - 像素渲染」範式,其中多模態大語言模型(MLLM)負責語義理解與規劃,而擴散變換器(DiT)則負責基於規劃進行高品質的視覺渲染。
- •Bernini 引入了分段感知 3D 旋轉位置編碼(SA-3D RoPE),以有效處理多源視覺輸入中時空座標的歧義問題。
- •該框架在其基於 MLLM 的規劃器中融入了思維鏈(CoT)推理機制,藉此增強模型將複雜指令從語義理解轉化為實際生成任務的能力。
- •「語義即介面」(Semantics-as-Interface)的核心思想,允許 MLLM 規劃器直接在 ViT 嵌入空間中預測目標語義表示,實現規劃器與渲染器解耦訓練,同時保留各自預訓練的優勢。
🛠️ 技術深入
- Bernini 的核心理念是「語義規劃 - 像素渲染」範式,將影片生成與編輯過程拆解為兩個主要階段。
- 規劃器(Planner)由多模態大語言模型(MLLM)構成,負責高層次的語義理解、意圖解析及多參考資料的錨定(grounding)。
- 渲染器(Renderer)由擴散變換器(DiT)模型構成,負責基於規劃器提供的語義引導和低階視覺特徵,進行高保真度的像素合成。
- MLLM 規劃器直接在 ViT 嵌入空間中預測目標語義表示,此 ViT 嵌入空間充當規劃器與渲染器之間的「語義介面」。
- 這種「語義即介面」的方法允許規劃器和渲染器獨立訓練,僅需少量聯合訓練即可協同工作,從而保留了兩個組件各自預訓練的優勢。
- 為了處理多個視覺輸入(如參考圖像、參考影片),Bernini 引入了分段感知 3D 旋轉位置編碼(Segment-Aware 3D RoPE),以解決時空座標的歧義。
- 規劃器中嵌入了思維鏈(Chain-of-Thought, CoT)推理機制,以更有效地將複雜指令從理解階段遷移到生成任務。
- 在影片編輯任務中,Bernini 額外利用來源影片的 VAE 特徵,以更好地保留細節和維持幀間一致性。
- 該框架支援多種影片生成任務,包括文字生成影片(T2V)、圖像生成影片(I2V)、影片生成影片(V2V)以及基於參考的影片生成(RV2V)。
🔮 前景展望AI analysis grounded in cited sources
「語義規劃 - 像素渲染」範式將成為複雜 AI 影片編輯與生成的主流方法。
透過將語義理解與像素生成解耦,Bernini 有效解決了當前 AI 模型難以精確理解用戶意圖的痛點,有望帶來更具可控性和一致性的 AI 影片創作成果。
Bernini 的開源將加速整個 AI 影片生態系統的創新,特別是在客製化應用方面。
提供一個具有清晰分工的開源框架,將降低開發者將先進語義理解能力整合到其 AI 影片工具中的門檻,從而促進社群的共同發展。
字節跳動將進一步鞏固其在 AI 驅動內容創作工具領域的領先地位。
透過提供如 Bernini 這樣先進的開源框架以及強大的影片生成模型(如 Seedance 2.0),字節跳動能夠吸引更多開發者和研究人員,強化其生態系統的影響力。
⏳ 時間線
2025-06
字節跳動首次發布 Seedance 2.0 的初始版本。
2025-11
字節跳動在 GitHub 上展示其多個開源項目,涵蓋 AI 與機器學習領域。
2026-02
字節跳動旗下 Niobotics 團隊發布 Seedance 2.0(當前版本),實現原生 1080p 電影級畫質的文字到影片生成。
2026-02-12
Seedance 2.0 透過 Seedance 研究頁面正式推出。
2026-05-20
Bernini 相關論文《Bernini: Latent Semantic Planning for Video Diffusion》在 ModelScope 上發布。
2026-06-02
字節跳動開源 Bernini 框架,賦能 AI 影片編輯。
📎 來源 (10)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗