📲較早收集於 36m

Gemini 應用程式重大更新,新增影片生成功能

Gemini 應用程式重大更新,新增影片生成功能
PostLinkedIn
📲閱讀原文: Digital Trends

💡Gemini 的全新影片生成與代理功能,代表多模態個人 AI 助理的重大飛躍。

⚡ 30-Second TL;DR

有什麼變化

新增電影級影片生成功能

為什麼重要

影片生成與代理任務管理功能的加入,使 Gemini 成為全方位的個人助理,加劇了消費級 AI 市場的競爭。

下一步行動

透過 Gemini API 測試新的影片生成功能,探索自動化內容創作的潛在應用場景。

誰應關注:Creators & Designers

關鍵要點

  • 新增電影級影片生成功能
  • 新增每日摘要的晨間簡報功能
  • 24/7 代理可自動管理數位任務
  • 提供更豐富、更詳細的回答生成

🧠 深度解析

Web-grounded analysis with 35 cited sources.

🔑 增強重點摘要

  • Gemini 的影片生成功能名為 Gemini Omni(或 Veo 3.1/Omni Flash),它能將圖像、音訊、影片和文字等多模態輸入結合,生成高品質影片,並支援透過自然對話編輯現有影片,同時保持內容元素的一致性。
  • 24/7 全天候代理功能被命名為 Gemini Spark,旨在主動管理跨應用程式(如 Gmail、日曆、文件)的任務,並能學習用戶偏好,設定重複性任務、學習新技能及建立完整的工作流程。
  • 晨間簡報功能「Daily Brief」是個人化的,由個人智慧(Personal Intelligence)驅動,它能從連接的應用程式和 Gemini 聊天中提取優先事項,並以「最受關注」(Top of Mind)和「展望未來」(Look Ahead)的視圖組織用戶的一天。
  • Gemini Omni Flash 正在 Gemini 應用程式、Google Flow 和 YouTube Shorts 中推出,並提供創建與用戶外觀和聲音相似的數位替身功能。所有生成的影片都將嵌入 SynthID 數位浮水印以驗證其 AI 生成來源。
  • Gemini 3.5 Flash 是下一代模型中的首個,它結合了前沿智慧與閃電般的速度,而 Gemini Spark 則運行於 Gemini 3.5 並採用 Antigravity 框架。
📊 競品分析▸ Show
功能/定價/基準Google GeminiOpenAI SoraAnthropic ClaudeMicrosoft Copilot
多模態輸入文字、程式碼、圖像、音訊、影片文字 (生成影片)文字、圖像文字、圖像、語音
多模態輸出文字、圖像、音訊、影片 (Gemini Omni/Veo 3.1)影片文字文字
上下文窗口1.5 Pro 高達 100 萬 tokens;3.1 Pro 高達 200 萬 tokens未公開具體數字約 15 萬字 (~20 萬 tokens)未公開具體數字
即時網路存取無 (基於預訓練知識)無 (基於預訓練知識)有 (由 Bing 提供)
代理功能Gemini Spark (24/7 個人 AI 代理,主動任務管理,工作流程,第三方整合)多代理自動化,Copilot Cowork (多步驟任務)
影片生成Gemini Omni/Veo 3.1 (電影級影片生成,多模態輸入,編輯現有影片,數位替身,SynthID 浮水印)文字轉影片 (逼真場景,細緻角色/背景,物理互動理解有限)
整合生態系統Google Workspace, Android, Chrome, iOS, Vertex AI獨立模型Anthropic API, AWS BedrockMicrosoft 365, Outlook, Teams, Word, Excel, PowerPoint, Edge
個人版定價免費 (Flash/Flash-Lite API, 基本應用程式功能);Gemini Advanced (Google One AI Premium) $19.99/月 (1.5 Pro, 2TB 儲存);Google AI Ultra $100/月 (進階功能), $200/月 (最高限制,含 Omni, 20TB 儲存, YouTube Premium)需付費 (Sora 無浮水印版本更昂貴)免費 (Claude 4 Sonnet 有每日限制)整合於 Microsoft 365 訂閱 (具體定價未詳述)
企業版定價Workspace Business $20/用戶/月;Enterprise $30/用戶/月;API 定價依模型和 tokens 數量而異 (例如 3.1 Pro $2/$12 每百萬 tokens 輸入/輸出)未公開API 定價 (Opus 4.5: $5/百萬輸入 tokens, $25/百萬輸出 tokens)整合於 Microsoft 365 企業版 (具體定價未詳述)
基準表現Ultra 在 MMLU 上 90.0% 超越人類專家;3.1 Pro 在 ARC-AGI-2 上 77.1%,SWE-Bench Verified 上 80.6%;1.5 Pro 在 87% 基準上優於 1.0,在 32 個關鍵基準中 30 個超越 ChatGPT逼真影片生成能力強,但物理互動理解有待提升Claude 3.5 在推理基準上達到研究生水平未公開具體基準,但強調在 Microsoft 應用程式中的效率

🛠️ 技術深入

  • 模型架構: Gemini 是一個多模態大型語言模型 (LLM) 系列,是 LaMDA 和 PaLM 2 的繼任者。它從頭開始設計為多模態,原生訓練於多種資料類型,可同時處理文字、程式碼、圖像、音訊和影片。
  • 核心技術: 採用 Google 於 2017 年推出的 Transformer 模型架構。Gemini 1.5 Pro 還應用了專家混合 (Mixture of Experts, MoE) 架構,其中較小的「專家」神經網路專精於特定領域。
  • 上下文窗口: Gemini 1.5 Pro 提供 100 萬 tokens 的上下文窗口,可處理約一小時的影片、11 小時的音訊或 3 萬行程式碼。Gemini 3.1 Pro 支援 200 萬 tokens 的上下文窗口。
  • 影片生成 (Omni/Veo): Gemini Omni 是一個新模型,能夠「從任何輸入創建任何輸出——從影片開始」。它結合圖像、音訊、影片和文字作為輸入,生成基於 Gemini 真實世界知識的高品質影片。它能更好地理解物理力學(如重力、動能和流體動力學),使場景更逼真。所有生成的影片都嵌入 SynthID 數位浮水印。 Veo 3.1 可生成 8 秒的 720p、1080p 或 4k 影片,並原生生成音訊(旁白、音效和背景音樂)。它支援縱向/橫向影片、影片延伸、特定幀生成和基於圖像的指導。
  • 代理框架: Gemini Spark 運行於 Gemini 3.5 Flash 並使用 Google Antigravity 開發平台,這是一個 AI 原生 IDE,有助於防止代理失控。它將透過模型上下文協議 (Model Context Protocol, MCP) 與第三方工具整合。

🔮 前景展望AI analysis grounded in cited sources

AI 助理將成為日常數位任務管理不可或缺的工具。
Gemini Spark 的 24/7 主動代理功能,整合跨多個應用程式並學習用戶偏好,將顯著減輕數位雜務並簡化工作流程。
影片內容創作將變得高度普及和個人化。
Gemini Omni 能夠從多種多模態輸入(包括個人替身)生成和編輯電影級影片,將使日常用戶和創作者都能輕鬆進行影片製作。
AI 助理與自主代理之間的界線將模糊,導致更複雜的 AI 驅動工作流程。
Gemini Spark 能夠設定重複性任務、學習新技能和創建完整工作流程,並透過 MCP 與第三方服務整合,預示著 AI 將主動執行多步驟操作。

時間線

2023-02
Google 執行長 Sundar Pichai 宣布推出 Bard,這是一個由 LaMDA 驅動的實驗性對話式 AI 服務。
2023-12-06
Google 宣布推出 Gemini,這是一個更大、多模態的 LLM 系列,並將調整後的 Gemini Pro 整合到 Bard 中。
2024-02
Bard 聊天機器人更名為 Gemini,並將 Google Cloud 和 Workspace 的「Duet AI」品牌替換為 Gemini 識別符。
2024-05
Google I/O 宣布推出 Gemini 1.5 Flash,並擴展 Gemini Advanced,其中 Gemini 1.5 Pro 以其 100 萬 tokens 的上下文窗口而聞名。
2024-12-11
Google 宣布推出 Gemini 2.0 Flash 作為 Gemini 2.0 系列中的第一個模型,支援原生多模態輸出和改進的代理功能。
2026-05-19
Google 宣布推出 Gemini Omni(電影級影片生成)、Gemini Spark(24/7 代理)和 Daily Brief 功能,以及 Gemini 3.5 Flash。

📰 事件追蹤

📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Digital Trends