💻ZDNet AI•較早收集於 2h
Google Gemini Omni 推出先進的 AI 影片複製功能

💡Google 的新型影片複製工具可能會重新定義合成媒體的製作流程。
⚡ 30-Second TL;DR
有什麼變化
結合真實感與風格控制以進行影片生成
為什麼重要
此工具可能大幅降低高品質影片內容創作的門檻,進而影響行銷與合成媒體產業。
下一步行動
註冊 Google 的 AI 開發者預覽計畫,以測試影片生成 API 的搶先體驗。
誰應關注:Creators & Designers
關鍵要點
- •結合真實感與風格控制以進行影片生成
- •支援針對複雜影片任務的自然語言編輯
- •實現高品質的 AI 虛擬化身創作
- •定位為 AI 影片製作的綜合性工具
🧠 深度解析
Web-grounded analysis with 14 cited sources.
🔑 增強重點摘要
- •Google Gemini Omni被定位為一個「世界模型」,旨在從任何輸入生成任何輸出,其初步展示著重於影片生成,並被視為實現通用人工智慧(AGI)的關鍵一步。
- •Gemini Omni是一個真正的多模態輸入和輸出系統,能夠同時接受文字、音訊、圖像和現有影片作為輸入,並利用Gemini的「真實世界知識」生成獨特、互動式的世界,甚至能同步輸出音訊。
- •該模型能夠生成具有更精確物理原理(如重力、動能和流體動力學)的影片,並理解提示的歷史、科學和文化背景,以創造更真實、更連貫的內容。
- •Gemini Omni支援多輪對話式編輯,使用者可以透過自然語言描述來迭代地精修影片的特定方面,例如改變背景、風格、角度或特定細節,而無需重新生成整個影片。
- •為確保內容的真實性與可追溯性,所有透過Gemini Omni生成的影片都將嵌入Google的SynthID浮水印,以便驗證其為AI生成內容。
📊 競品分析▸ Show
| 功能/產品 | Google Gemini Omni (Flash) | OpenAI Sora | RunwayML | Synthesia / HeyGen |
|---|---|---|---|---|
| 核心能力 | 多模態影片生成與對話式編輯,真實感、風格控制、AI虛擬化身、物理理解、世界模型。 | 從文字生成高擬真、電影級影片,專注於敘事。 | 完整的創意套件,文字轉影片、圖像轉影片、編輯工具,提供進階創意控制。 | 高品質數位虛擬化身、個性化影片、多語言支援。 |
| 輸入模態 | 文字、音訊、圖像、現有影片。 | 文字。 | 文字、圖像、影片。 | 文字(腳本)、音訊。 |
| 輸出模態 | 影片(含同步音訊)、互動式世界。 | 影片(含同步音訊)。 | 影片。 | 影片(含虛擬化身和語音)。 |
| 編輯能力 | 多輪對話式編輯,可改變背景、風格、角度、物件等。 | 迭代通常意味著重新生成。 | 整合編輯工具。 | 腳本編輯、虛擬化身調整。 |
| 真實感/物理 | 具備更精確的物理理解(重力、動能、流體動力學),以及歷史、科學、文化背景知識。 | 以逼真、電影級世界著稱。 | 強調電影級運動和真實感。 | 專注於虛擬化身的面部表情和唇形同步。 |
| 定價 | 透過付費Google AI Plus、Pro和Ultra訂閱者推出,稍後將免費提供給YouTube Shorts和YouTube Create應用程式使用者。 | 免費,付費方案每月20美元起。 | 每月15美元起。 | Synthesia:基本免費,入門方案每月29美元起;HeyGen:每月29美元起。 |
| 水印 | 所有生成影片嵌入SynthID浮水印。 | 未明確提及,但AI生成內容通常有標識。 | 未明確提及。 | 生成內容通常有標識。 |
🛠️ 技術深入
- Gemini Omni被設計為一個「世界模型」,旨在從任何輸入生成任何輸出,是Google邁向通用人工智慧(AGI)的關鍵一步。
- 其核心架構是基於Gemini模型,採用統一的Transformer架構,而非傳統的多模態AI管道。
- 在此統一架構中,文字、圖像、音訊和影片的token共享相同的潛在空間,模型能夠原生處理所有模態,無需在不同格式之間轉換。
- 該模型整合了Gemini的智慧和進階推理能力,使其能夠理解並模擬真實世界的物理現象,包括重力、動能和流體動力學,從而生成更具真實感的影片。
- Omni能夠處理多模態輸入,並生成多模態輸出,包括與影片內容同步的音訊(如音效、環境噪音和潛在的音樂)。
- 支援跨模態推理,例如根據文字描述生成影片,同時參考上傳圖像的視覺風格,或從音訊片段生成符合情緒的視覺效果。
- 具備記憶先前指令的能力,可在多步驟編輯過程中保持連貫性,實現流暢的迭代創作。
- 所有生成的內容都將嵌入Google的SynthID浮水印,以確保其可驗證性。
🔮 前景展望AI analysis grounded in cited sources
AI影片製作將變得高度普及並融入日常創意工作流程。
Gemini Omni的自然語言編輯、多模態輸入以及與Google應用程式(如Gemini應用程式、YouTube Shorts/Create)的整合,將顯著降低影片創作和編輯的門檻。
對於許多常見任務而言,對專業影片編輯軟體的需求可能會減少。
Omni能夠透過對話方式執行複雜的多輪編輯,包括改變背景、風格和物件,這可能取代非專業使用者對傳統複雜編輯工具的需求。
真實與AI生成影片內容之間的界線將日益模糊,需要更強大的檢測機制。
Omni對逼真物理、上下文理解和高擬真輸出的專注,結合先進的虛擬化身創建功能,將使AI生成影片極具說服力,從而使SynthID變得至關重要。
⏳ 時間線
2022-10
Google收購AI虛擬化身新創公司Alter,為先進虛擬化身技術奠定基礎。
2023-05
Google I/O 2023宣布推出多模態大型語言模型Gemini,預示著AI整合的轉變。
2023-12
Gemini 1.0 Pro和Ultra模型發布,建立Gemini基礎模型家族。
2025-05
Google I/O 2025宣布推出AI影片編輯套件Google Flow,展現Google在影片製作AI領域的投入。
2025-11
Gemini 3.0 Pro發布,代表核心Gemini模型能力的重大升級。
2026-05-19
Google在Google I/O 2026上發布Gemini Omni (Flash),整合先進的多模態影片生成與編輯功能。
📎 來源 (14)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ZDNet AI ↗


