多模態 AI最新動態
能看、能聽、能說的模型正在取代純文字系統。覆蓋視覺語言模型、原生音頻與視頻理解進展。
303 篇文章
Google 發佈 Gemini 3.5 Flash 與 AI 智能體生態
Google 在 I/O 2026 大會上發佈了 Gemini 3.5 Flash、原生多模態模型 Omni 以及 AI 助手 Spark。Google 正積極將這些工具整合至全線產品,旨在主導 AI 智能體市場。
Google I/O 速覽:AI 進入一切,模型只是起點
Google I/O 大會聚焦於將 AI 整合至全產品線,推出了 Gemini Omni 世界模型與高性價比的 Gemini 3.5 Flash,旨在推動企業與消費端的廣泛應用。
推出 Gemini Omni
Google 正式推出 Gemini Omni,這是一款專為即時、低延遲互動而設計的多模態模型。該模型透過提供無縫的跨模態處理,增強了 Gemini 生態系統的功能。
Gemma 4 發布:多模態開放模型
Google DeepMind 推出 Gemma 4,這是開放權重多模態模型,尺寸包括 E2B、E4B、26B A4B 和 31B。它們處理文字、圖像、影片和音訊,具備高達 256K 上下文,並強化推理、程式設計和代理功能。提供 Dense 和 MoE 變體,適合裝置端部署。
西湖大學與阿里達摩院推出「歸元」幹細胞 AI 模型
西湖大學與阿里達摩院共同開發了「歸元」AI 模型,旨在預測幹細胞命運。透過分析數百萬種分子組合,該模型能精準調控細胞重編程,大幅加速生物學研究進程。
SenseNova-Vision:統一開源視覺基礎模型發布
商湯科技發布 SenseNova-Vision,這是一款將目標檢測、分割、3D 重建等任務整合的統一視覺基礎模型。該模型已全面開源,並同步釋出 5000 萬條視覺指令語料庫。
Infinity-Parser2:全新 SOTA 多模態文件解析模型
Infinity-Parser2 是一款全新的多模態模型,具備 500 萬樣本的合成語料庫與多任務強化學習框架。該模型在文件解析基準測試中達到頂尖水準,超越了 DeepSeek-OCR-2 等模型。
Meta 發布 Muse Spark 1.1 與全新低成本 API
Meta 發布了「Muse Spark 1.1」,這是一款增強了工具操作與複雜程式編寫能力的代理型多模態推理模型。該模型透過新設立的「Meta Model API」提供,定價低於競爭對手。
Meta 發布用於程式編寫的 Muse Spark 1.1
Meta 推出了 Muse Spark 1.1,這是一款專為進階程式編寫任務設計的升級版 AI 模型。它具備改進的錯誤偵測、支援多代理工作流程以及原生多模態感知能力。
騰訊延攬前 OpenAI 研究員田永龍,投入 VLM 研發
騰訊延攬前 OpenAI 研究員田永龍加入大語言模型部門,後續將投入視覺語言模型(VLM)的研發工作。
生數科技發布 Vidu S1 即時交互模型
生數科技正式發布 Vidu S1,這是一款具備即時交互能力的新一代影片生成模型,支援語音控制與高畫質輸出。
全球首發:端側流式多模態模型問世
杭州的一個團隊成功將流式多模態模型部署到端側,標誌著 CVPR 2026 趨勢的一個重要里程碑。
像素級圖片攻擊繞過 AI 聊天機器人安全規則
佛羅里達國際大學的研究人員發現,圖像中不可見的像素級修改可以迫使 AI 聊天機器人繞過其安全防護機制,並生成受限內容。
介紹 Gemma 4 12B:統一的多模態模型
Google DeepMind 發布了 Gemma 4 12B,這是一款全新的無編碼器多模態模型。此次發布擴展了 Gemma 系列,增強了處理多樣化數據類型的能力。
Google 發布開源 Gemma 4 12B 多模態模型
Google 發布了 Gemma 4 12B 多模態模型,旨在於消費級硬體上本地運行。該模型在僅需 16GB 記憶體的條件下,提供了媲美 26B 版本的效能。
Google 發布可在本地 PC 運行的 Gemma 4 12B 多模態模型
Google 發布了專為高效能設計的開放多模態模型「Gemma 4 12B」。該模型採用無編碼器架構,可在具備 16GB 記憶體的筆記型電腦上運行。
全球首個全模態 API 正式開放,即日起無限期免費
頂尖 AI 實驗室發布了全球首個全模態 API,即日起無限期免費開放。該 API 支援文字、圖像與影片數據的無縫處理。
Google Gemini 3.5 與 AI 產業變革
Google 發布了 Gemini 3.5 Flash 與 Omni 模型,同時產業迎來重大變革,包括 Anthropic 延攬 Andrej Karpathy 以及 AMD 擴展本土 AI 算力基礎設施。AI 競爭正從參數比拼轉向生態構建與行業滲透。
Google 發布 Gemini 3.5 與全新 AI Agent 產品
Google 正式發布了 Gemini 3.5 模型,並同步推出全新的 AI Agent 功能與先進的影片生成模型。此次發布標誌著 Google 的產品策略正顯著轉向自主 AI Agent。
Intern-S2-Preview:高效能 35B 科學多模態模型
Intern-S2-Preview 是一款全新的 35B 科學基礎模型,透過擴展任務難度與多樣性來提升效能。該模型具備增強的代理能力,並利用思維鏈(CoT)壓縮技術實現高效的強化學習。
Ovis2.6-80B-A3B:具備主動視覺能力的 MoE 多模態模型
AIDC-AI 推出了 Ovis2.6-80B-A3B,這是一款採用專家混合(MoE)架構的多模態大型語言模型。它具備「圖像思考」(Think with Image)能力,允許模型在推理過程中主動操作視覺輸入。
NVIDIA 推出 Nemotron 3 Nano Omni 多模態模型
NVIDIA 推出 Nemotron 3 Nano Omni,這是一款緊湊的長上下文多模態模型,用於建構處理文件、音頻和視頻的智能代理。該模型託管於 Hugging Face,推進高效多模態 AI 能力。此發布針對尋求輕量但強大解決方案的代理開發者。
商湯科技發布開源SenseNova U1系列模型
商湯科技正式發布並開源日日新SenseNova U1系列原生理解生成統一模型。基於今年三月自主研發的NEO-unify架構,在單一模型架構上統一多模態理解、推理與生成。該模型將語言與視覺資訊作為統一複合體直接建模,實現高效協同,保留語義豐富度並維持像素級視覺保真度。
小米 MiMo-V2.5 主宰代理爪任務效率
小米推出開源 MiMo-V2.5 和 V2.5-Pro 模型,採用 MIT 授權,可於 Hugging Face 下載用於商業應用。它們在如 OpenClaw 的代理「爪」任務中領先,Pro 版達 63.8% 成功率僅用 ~70K 令牌,比 Claude 或 GPT 少 40-60%。具 310B 參數與 1M 令牌上下文,挑戰閉源前沿模型。
Qwen3.6-27B 無審查積極版推出
全新無審查 Qwen3.6-27B Aggressive 模型發布,附優化 K_P GGUF 量化版本。實現 0 拒絕率,無能力損失,支持多模態輸入。對提示清晰度敏感;透過 Jinja 參數停用思考模式。
Qwen3.6-35B Uncensored Aggressive 發布
Qwen3.6-35B-A3B 的全新無審查激進變體發布,支援 K_P 量化與完整多模態功能。零拒絕、無能力損失,優化本地推理。包含多種量化版本、視覺 mmproj 與 262K 上下文。
Claude Opus 4.7 基準測試領先程式碼表現
Anthropic 推出 Claude Opus 4.7,其最強通用模型在 SWE-bench Pro 達 64.3%(優於 GPT-5.4 的 57.7%),支援長時程多代理協調、3 倍影像解析度,以及代理推理提升 14% 並減少工具錯誤。定價:每百萬 token 輸入 $5/輸出 $25。
Qwen3.6-35B-A3B 開源 MoE 模型發布
Qwen3.6-35B-A3B 是全新開源稀疏 MoE 模型,總參數 35B,活躍參數 3B,採用 Apache 2.0 許可。代理編碼能力媲美活躍參數大 10 倍的模型,並具強大多模態感知與思考/非思考模式。可於 HuggingFace、ModelScope 及 Qwen Studio 下載。
阿里巴巴 Happy Horse 登頂影片生成基準
阿里巴巴上週低調發布 Happy Horse AI 影片生成器。目前它在關鍵影片生成基準測試中排名第一。這讓阿里巴巴成為 AI 影片合成領域的領先者。
無審查 Gemma 4 E4B/E2B 多模態發布
發布 Gemma 4 E4B (4B) 與 E2B (2B) 的積極無審查變體,完全多模態支援文字、圖像、影片與音頻。在 Hugging Face 提供高品質 GGUF 量化,與 llama.cpp 相容。即將推出 E31B 與 E26B 更大模型。