
Gemini Omni 影片模型 I/O 前曝光
Google 的 Gemini Omni 影片模型短暫在網上曝光,揭示即將推出的影片編輯功能。此洩漏發生在其預計於 Google I/O 2026 亮相之前。
Tag: #multimodal-ai55 results

Google 的 Gemini Omni 影片模型短暫在網上曝光,揭示即將推出的影片編輯功能。此洩漏發生在其預計於 Google I/O 2026 亮相之前。

汽車駕駛艙正從規則基礎介面轉變為代理式、多模態 AI 系統,能推理、規劃與行動。目前車輛助理依賴固定命令-回應模式,無法擴展至現代需求。NVIDIA 提供從雲端到車輛的建構指南。

Google 正在測試名為 Omni 的全新影片生成模型,可能為 Gemini 工具。使用者介面洩漏顯示其即將於 2026 I/O 亮相。這顯示 Google 進軍進階多媒體 AI 的意圖。

微軟推出三款內部 AI 模型:MAI-Transcribe-1 語音轉錄、MAI-Voice-1 語音生成、MAI-Image-2 圖像創作,針對企業高價值 AI 能力。此舉支持微軟 2027 年獨立打造頂尖模型目標,降低對 OpenAI 依賴。

阿里巴巴通義實驗室推出 PrismAudio,一個視頻轉音頻生成框架。它使用「先思考後生成」AI,從視頻產生完美同步的環境音效。這推進了多模態 AI 在內容創作的應用。

Google 將 Search Live 全球推廣至超過 200 個提供 AI Mode 的國家,繼去年 9 月美國推出後。該功能允許使用者將手機相機對準物件或場景提問,現已升級至 Gemini 3.1 Flash 模型,提供更自然、更快速且多語言對話。可透過 Android 和 iOS 的 Google 應用程式或 Lens 存取。

據知情人士透露,OpenAI 計劃近期在 ChatGPT 上線 Sora AI 影片生成功能。此戰略調整距推出獨立 Sora 手機應用約五個月。該應用模仿 TikTok 介面但未獲廣泛歡迎,可能提升使用量同時增加營運成本。

Google 推出全新 Nano Banana 2 AI 影像模型,今天即將登陸 Gemini。它立即取代 Gemini 中所有先前的影像模型版本。
DeepMind 推出手語轉文字(SL2T)模型,旨在為聾人及聽力障礙使用者提供手語功能。這項更新著重於將手語 AI 帶入實際的使用者體驗。
DeepSeek 宣布計畫大幅調高 API 價格,正式方案仍待公布。文章認為,漲價是出於商業永續考量,也可能讓 DeepSeek 的性價比逐漸接近其他先進國產模型。