
DeepSeek 終於推出 Vision 模型
DeepSeek 發布了最新模型 DeepSeek-V4-Flash-Vision-Exp,核心聚焦於視覺能力。這項發布代表該公司在長時間醞釀後,終於推出多模態模型更新。
Tag: #multimodal328 results

DeepSeek 發布了最新模型 DeepSeek-V4-Flash-Vision-Exp,核心聚焦於視覺能力。這項發布代表該公司在長時間醞釀後,終於推出多模態模型更新。

DeepSeek 已在 API 平台推出 V4-Flash-Vision-Exp 模型,支援在文字之外輸入圖片,執行視覺分析等任務。該公司表示,其多模態 Agent 能力大幅提升,在視覺 Agent 基準測試中的表現已接近 Opus-4.8。

MiniMax H3 提供高品質的影片生成與編輯能力,支援最高 2K 輸出,價格約為每秒人民幣 0.8 元。H3 發布後不久,MiniMax 推出 MiniMax Design 內測,這是一個以 Agent 為核心的工作空間,可拆解創意任務並協調多個 AI Agent 完成端到端影片製作。

Xiaohongshu 發布 dots3-note preview,這是一個總參數 280B、啟用參數 16B 的開放權重 MoE 模型。該模型支援 512K 上下文,以及文字、視覺與語音理解,並以 Apache 2.0 授權釋出。

SenseTime 已開源 SenseNova U1.5 Lite,這是一款結合視覺理解、影像生成與編輯功能的 80 億參數多模態模型。模型支援原生 4K 影像輸出,並針對主體、數量、空間關係、文字、版面與視覺風格等要求進行設計。

據報 Tencent 的 Hunyuan Hy4 已出現在 Yuanbao App 的模型選擇清單中,被標示為專家級模型,並具備工具使用能力。它的定位高於 Hy3,並與 DeepSeek 並列;此前 Tencent 曾表示,更大參數規模的 Hy4 將很快推出,並提升效能與多模態能力。

Mistral AI 發布 Shieldstral,這是一款 30 億參數、可適應規則的多模態安全分類器,支援文字、圖片與圖文混合輸入。它將審核轉化為自然語言規則匹配,據報在多項安全基準上接近甚至超越更大型模型。

智象未來推出 HiDream-O1-World,這是一款支援文字、圖像與互動輸入,可用於生成、漫遊與編輯世界的原生全模態互動世界模型。該模型搭載升級版 UiT 架構,在 WBench 的 Navi 榜單以 80.9 平均分排名第一。

據報導,一款新的世界模型可即時生成 24FPS 畫面與 48kHz 立體聲音訊。該專案預計即將完全開源。

Google 在 I/O 2026 大會上發佈了 Gemini 3.5 Flash、原生多模態模型 Omni 以及 AI 助手 Spark。Google 正積極將這些工具整合至全線產品,旨在主導 AI 智能體市場。