
Google I/O 速覽:AI 進入一切,模型只是起點
Google I/O 大會聚焦於將 AI 整合至全產品線,推出了 Gemini Omni 世界模型與高性價比的 Gemini 3.5 Flash,旨在推動企業與消費端的廣泛應用。
Tag: #multimodal328 results

Google I/O 大會聚焦於將 AI 整合至全產品線,推出了 Gemini Omni 世界模型與高性價比的 Gemini 3.5 Flash,旨在推動企業與消費端的廣泛應用。

Google 正式推出 Gemini Omni,這是一款專為即時、低延遲互動而設計的多模態模型。該模型透過提供無縫的跨模態處理,增強了 Gemini 生態系統的功能。

據報導,Tencent 正將多模態 AI 方向從內容生成轉向上下文理解與在真實世界中行動。這項轉變似乎更接近梁文鋒對推理與執行的重視,也與 Fei-Fei Li 偏向世界模型的研究路線有所區隔。

文章指出,隨著 AI 模型持續擴大並拓展至多模態應用,高品質且可合法使用的訓練資料正逐漸稀缺。出版商與內容擁有者可能因此取得新的議價能力,但版權複雜性、資料工程成本、合成資料與模型效率提升,仍可能限制其定價權。

西湖大學與阿里達摩院共同開發了「歸元」AI 模型,旨在預測幹細胞命運。透過分析數百萬種分子組合,該模型能精準調控細胞重編程,大幅加速生物學研究進程。

商湯科技發布 SenseNova-Vision,這是一款將目標檢測、分割、3D 重建等任務整合的統一視覺基礎模型。該模型已全面開源,並同步釋出 5000 萬條視覺指令語料庫。

Infinity-Parser2 是一款全新的多模態模型,具備 500 萬樣本的合成語料庫與多任務強化學習框架。該模型在文件解析基準測試中達到頂尖水準,超越了 DeepSeek-OCR-2 等模型。
Meta 發布了「Muse Spark 1.1」,這是一款增強了工具操作與複雜程式編寫能力的代理型多模態推理模型。該模型透過新設立的「Meta Model API」提供,定價低於競爭對手。

Meta 推出了 Muse Spark 1.1,這是一款專為進階程式編寫任務設計的升級版 AI 模型。它具備改進的錯誤偵測、支援多代理工作流程以及原生多模態感知能力。
騰訊延攬前 OpenAI 研究員田永龍加入大語言模型部門,後續將投入視覺語言模型(VLM)的研發工作。