🧬DeepMind Blog•較早收集於 46h
推出 Gemini Omni

💡一個專注於低延遲多模態效能的重大模型發布。
⚡ 30-Second TL;DR
有什麼變化
針對即時、低延遲的多模態互動進行優化
為什麼重要
Gemini Omni 為對話式 AI 設定了新標準,實現了更自然且反應靈敏的人機互動。
下一步行動
更新您的 API 呼叫以使用新的 Gemini Omni 端點,以減少語音 AI 應用程式的延遲。
誰應關注:Developers & AI Engineers
關鍵要點
- •針對即時、低延遲的多模態互動進行優化
- •在文字、音訊與視覺輸入之間進行無縫處理
- •擴展了 Gemini 模型家族的功能
🧠 深度解析
Web-grounded analysis with 25 cited sources.
🔑 增強重點摘要
- •Gemini Omni 是一款據報導或洩露的下一代模型,於 2026 年 Google I/O 大會(5 月 19 日至 20 日)正式發布,而非此前已公開宣布的模型。
- •該模型專為原生多模態生成而設計,能夠在單一統一架構中生成影片、圖像、文字和音訊,這與之前理解多種模態但依賴獨立系統(如用於影片的 Veo 或用於圖像的 Nano Banana)進行生成的 Gemini 模型不同。
- •Gemini Omni 的核心功能包括對話式影片編輯、物件和場景級別編輯、影片混音以及具備世界知識的創作,讓使用者能夠透過對話方式修改影片並確保內容在語境上合理。
- •Gemini Omni 系列中的首個模型名為 Gemini Omni Flash,已開始在 Gemini 應用程式、Google Flow 和 YouTube Shorts 上推出。
- •該模型被視為實現通用人工智慧 (AGI) 的重要一步,因為它能夠理解和模擬物理世界,包括重力、動能和流體動力學等概念,從而生成更逼真的場景。
🛠️ 技術深入
- Gemini Omni 被描述為一個「統一的多模態生成模型」,將影片和圖像生成直接整合到核心模型中,這與之前使用獨立系統進行生成的 Gemini 版本不同。
- 該模型建立在 Google 現有的 Veo(影片生成)和 Imagen(圖像生成)等技術基礎之上。
- 其設計旨在解決影片生成中的關鍵技術挑戰,例如時間連貫性和長時間的提示遵循。
- Omni 利用 Gemini 的核心智慧,實現了具備世界知識的創作,並能理解物理概念。
- 之前的 Gemini 模型(如 1.5、2.0、2.5、3.0、3.1)採用統一的 Transformer 架構來處理各種資料類型,允許在每個層級進行跨模態注意力處理,Omni 很可能在此基礎上進行了擴展或改進。
- Gemini 1.5 Pro 曾採用多模態專家混合 (MoE) 方法,Omni 很可能也借鑒了這一點。
🔮 前景展望AI analysis grounded in cited sources
徹底改變內容創作工作流程。
透過對話式編輯和跨模態理解,Gemini Omni 將使影片和圖像創作變得像對話一樣簡單,大幅降低專業內容製作的門檻。
加速通用人工智慧 (AGI) 的發展。
Omni 能夠理解並模擬物理世界,包括重力、動能等概念,這被視為實現能夠理解和互動真實世界的 AI 的關鍵一步。
強化 Google 產品生態系統的即時互動能力。
Gemini Omni Flash 將整合到 Gemini 應用程式、Google Flow 和 YouTube Shorts 中,為用戶提供更無縫、即時的多模態體驗。
⏳ 時間線
2023-05
Google I/O 2023,Google 宣布 Gemini,定位為 PaLM 2 的更強大繼任者,並設計為多模態。
2023-12
Google 推出 Gemini 1.0 (Ultra, Pro, Nano),Bard 開始整合 Gemini Pro。
2024-02
Google 推出 Gemini 1.5 Pro,引入 100 萬 token 上下文窗口和 MoE 架構。Bard 更名為 Gemini。
2024-05
Google I/O 2024,宣布 Gemini 1.5 Flash,優化速度和效率。
2025-01
Gemini 2.0 Flash 成為預設模型,引入多模態 Live API 實現即時音訊和視訊互動。
2026-03
Google 推出 Gemini 3.1 Flash Lite 和 Gemini 3.1 Flash Live,後者為高品質、低延遲的即時對話模型。
2026-05-19
Google I/O 2026,正式推出 Gemini Omni,首個模型為 Gemini Omni Flash。
📎 來源 (25)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: DeepMind Blog ↗