來源DeepMind Blog•較早收集於 46h
推出 Gemini Omni

一個專注於低延遲多模態效能的重大模型發布。
30 秒速覽
有什麼變化
針對即時、低延遲的多模態互動進行優化
為什麼重要
Gemini Omni 為對話式 AI 設定了新標準,實現了更自然且反應靈敏的人機互動。
下一步行動
更新您的 API 呼叫以使用新的 Gemini Omni 端點,以減少語音 AI 應用程式的延遲。
誰應關注:Developers & AI Engineers
關鍵要點
- •針對即時、低延遲的多模態互動進行優化
- •在文字、音訊與視覺輸入之間進行無縫處理
- •擴展了 Gemini 模型家族的功能
深度解析
背景與延伸:來自公開資料,非原文內容。引用 25 個來源。
增強重點摘要
- •Gemini Omni 是一款據報導或洩露的下一代模型,於 2026 年 Google I/O 大會(5 月 19 日至 20 日)正式發布,而非此前已公開宣布的模型。
- •該模型專為原生多模態生成而設計,能夠在單一統一架構中生成影片、圖像、文字和音訊,這與之前理解多種模態但依賴獨立系統(如用於影片的 Veo 或用於圖像的 Nano Banana)進行生成的 Gemini 模型不同。
- •Gemini Omni 的核心功能包括對話式影片編輯、物件和場景級別編輯、影片混音以及具備世界知識的創作,讓使用者能夠透過對話方式修改影片並確保內容在語境上合理。
- •Gemini Omni 系列中的首個模型名為 Gemini Omni Flash,已開始在 Gemini 應用程式、Google Flow 和 YouTube Shorts 上推出。
- •該模型被視為實現通用人工智慧 (AGI) 的重要一步,因為它能夠理解和模擬物理世界,包括重力、動能和流體動力學等概念,從而生成更逼真的場景。
技術深入
- Gemini Omni 被描述為一個「統一的多模態生成模型」,將影片和圖像生成直接整合到核心模型中,這與之前使用獨立系統進行生成的 Gemini 版本不同。
- 該模型建立在 Google 現有的 Veo(影片生成)和 Imagen(圖像生成)等技術基礎之上。
- 其設計旨在解決影片生成中的關鍵技術挑戰,例如時間連貫性和長時間的提示遵循。
- Omni 利用 Gemini 的核心智慧,實現了具備世界知識的創作,並能理解物理概念。
- 之前的 Gemini 模型(如 1.5、2.0、2.5、3.0、3.1)採用統一的 Transformer 架構來處理各種資料類型,允許在每個層級進行跨模態注意力處理,Omni 很可能在此基礎上進行了擴展或改進。
- Gemini 1.5 Pro 曾採用多模態專家混合 (MoE) 方法,Omni 很可能也借鑒了這一點。
前景展望基於引用來源的 AI 分析
徹底改變內容創作工作流程。
透過對話式編輯和跨模態理解,Gemini Omni 將使影片和圖像創作變得像對話一樣簡單,大幅降低專業內容製作的門檻。
加速通用人工智慧 (AGI) 的發展。
Omni 能夠理解並模擬物理世界,包括重力、動能等概念,這被視為實現能夠理解和互動真實世界的 AI 的關鍵一步。
強化 Google 產品生態系統的即時互動能力。
Gemini Omni Flash 將整合到 Gemini 應用程式、Google Flow 和 YouTube Shorts 中,為用戶提供更無縫、即時的多模態體驗。
時間線
2023-05
Google I/O 2023,Google 宣布 Gemini,定位為 PaLM 2 的更強大繼任者,並設計為多模態。
2023-12
Google 推出 Gemini 1.0 (Ultra, Pro, Nano),Bard 開始整合 Gemini Pro。
2024-02
Google 推出 Gemini 1.5 Pro,引入 100 萬 token 上下文窗口和 MoE 架構。Bard 更名為 Gemini。
2024-05
Google I/O 2024,宣布 Gemini 1.5 Flash,優化速度和效率。
2025-01
Gemini 2.0 Flash 成為預設模型,引入多模態 Live API 實現即時音訊和視訊互動。
2026-03
Google 推出 Gemini 3.1 Flash Lite 和 Gemini 3.1 Flash Live,後者為高品質、低延遲的即時對話模型。
2026-05-19
Google I/O 2026,正式推出 Gemini Omni,首個模型為 Gemini Omni Flash。
- 2023-05Google I/O 2023,Google 宣布 Gemini,定位為 PaLM 2 的更強大繼任者,並設計為多模態。
- 2023-12Google 推出 Gemini 1.0 (Ultra, Pro, Nano),Bard 開始整合 Gemini Pro。
- 2024-02Google 推出 Gemini 1.5 Pro,引入 100 萬 token 上下文窗口和 MoE 架構。Bard 更名為 Gemini。
- 2024-05Google I/O 2024,宣布 Gemini 1.5 Flash,優化速度和效率。
- 2025-01Gemini 2.0 Flash 成為預設模型,引入多模態 Live API 實現即時音訊和視訊互動。
- 2026-03Google 推出 Gemini 3.1 Flash Lite 和 Gemini 3.1 Flash Live,後者為高品質、低延遲的即時對話模型。
- 2026-05-19Google I/O 2026,正式推出 Gemini Omni,首個模型為 Gemini Omni Flash。
來源 (25)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
1mindstudio.aivertexaisearch.cloud.google.com2medium.comvertexaisearch.cloud.google.com3google.comvertexaisearch.cloud.google.com4cnet.comvertexaisearch.cloud.google.com5engadget.comvertexaisearch.cloud.google.com6mashable.comvertexaisearch.cloud.google.com7blog.googlevertexaisearch.cloud.google.com8mobilesyrup.comvertexaisearch.cloud.google.com9livemint.comvertexaisearch.cloud.google.com10gemini.googlevertexaisearch.cloud.google.com11pixverse.aivertexaisearch.cloud.google.com12pollo.aivertexaisearch.cloud.google.com13androidcentral.comvertexaisearch.cloud.google.com14apiyi.comvertexaisearch.cloud.google.com15galileo.aivertexaisearch.cloud.google.com16techtarget.comvertexaisearch.cloud.google.com17wikipedia.orgvertexaisearch.cloud.google.com18lifearchitect.aivertexaisearch.cloud.google.com19blog.googlevertexaisearch.cloud.google.com20wikipedia.orgvertexaisearch.cloud.google.com21medium.comvertexaisearch.cloud.google.com229to5google.comvertexaisearch.cloud.google.com23blog.googlevertexaisearch.cloud.google.com24google.devvertexaisearch.cloud.google.com25inworld.aivertexaisearch.cloud.google.com
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: DeepMind Blog ↗
每週電子報
每週一封,可隨時退訂。
