來源較早收集於 3h

SenseTime 發布 SenseNova U1 統一多模態模型

閱讀原文: Pandaily
#multimodal#open-source#foundation-model

多模態 AI 的轉變:SenseNova U1 超越了拼接模式,邁向原生統一架構。

30 秒速覽

有什麼變化

原生統一架構取代了多模型拼接

為什麼重要

轉向原生統一架構減少了多模態管線的延遲與複雜度,有望提升即時 AI 應用的效能。

下一步行動

下載 SenseNova U1 權重,並將其多模態推理能力與現有的 GPT-4o 等模型進行基準測試。

誰應關注:Researchers & Academics

關鍵要點

  • 原生統一架構取代了多模型拼接
  • 在單一空間中整合多模態理解與生成
  • 開源發布旨在為多模態 AI 樹立新典範

深度解析

背景與延伸:來自公開資料,非原文內容。引用 35 個來源。

增強重點摘要

  • 商湯SenseNova U1模型於2026年4月28日正式發布並全面開源,其底層基於商湯於2026年3月自主研發的NEO-unify架構。
  • SenseNova U1採用無編碼器設計,徹底摒棄了傳統多模態模型中常見的視覺編碼器(VE)和變分自編碼器(VAE),直接將語言與視覺信息作為統一複合體進行建模,顯著降低信息損耗並提升效率。
  • SenseNova U1 Lite輕量版包含8B稠密與A3B混合專家(MoE)兩款規格,在多項基準測試中達到同量級開源模型的SOTA(State-of-the-Art)水平,並在圖像生成質量上可媲美甚至超越部分大型商業閉源模型,如Qwen-Image 2.0 Pro或Seedream 4.5。
  • 該模型在業界首次實現單次調用、連續圖文創作輸出,能夠生成風格高度統一、邏輯連貫的步驟流程圖、信息長圖等,並能穩定輸出商業級品質的複雜信息圖表。
  • SenseNova U1已與壁仞科技、寒武紀、昆侖芯、摩爾線程、中科海光、平頭哥、昇騰等十家中國國產芯片公司完成Day 0適配,展現其在國產化生態中的兼容性與潛力。

競品分析

架構
商湯 SenseNova U1 (Lite 8B-MoT / A3B-MoT)
原生統一架構 (NEO-unify),無VE/VAE,單一模型統一理解、推理與生成
OpenAI GPT Image 2 / ChatGPT Images 2.0
傳統拼接式 (視覺編碼器+語言模型+VAE)
Google Gemini Nano Banana
原生多模態,直接處理多模態數據
Qwen-Image 2.0 Pro / Seedream 4.5
傳統拼接式
BAGEL / Ovis-U1 (開源)
傳統拼接式
性能基準 (SOTA)
商湯 SenseNova U1 (Lite 8B-MoT / A3B-MoT)
在同量級開源模型中全面SOTA,部分任務媲美或超越商業閉源模型
OpenAI GPT Image 2 / ChatGPT Images 2.0
頂級生成能力,但成本較高
Google Gemini Nano Banana
頂級生成能力,原生多模態處理
Qwen-Image 2.0 Pro / Seedream 4.5
商業級圖像生成質量
BAGEL / Ovis-U1 (開源)
較SenseNova U1低 (例如RealUnify分數)
推理速度
商湯 SenseNova U1 (Lite 8B-MoT / A3B-MoT)
顯著優於閉源大模型,低延遲
OpenAI GPT Image 2 / ChatGPT Images 2.0
未明確提及,但SenseNova U1成本更低
Google Gemini Nano Banana
未明確提及,但SenseNova U1成本更低
Qwen-Image 2.0 Pro / Seedream 4.5
較SenseNova U1慢
BAGEL / Ovis-U1 (開源)
未明確提及
成本
商湯 SenseNova U1 (Lite 8B-MoT / A3B-MoT)
生圖成本為ChatGPT Images 2.0的十分之一
OpenAI GPT Image 2 / ChatGPT Images 2.0
較高
Google Gemini Nano Banana
較高
Qwen-Image 2.0 Pro / Seedream 4.5
未明確提及
BAGEL / Ovis-U1 (開源)
未明確提及
特定能力
商湯 SenseNova U1 (Lite 8B-MoT / A3B-MoT)
首創連續性圖文創作輸出,商業級複雜信息圖生成,高密度信息呈現
OpenAI GPT Image 2 / ChatGPT Images 2.0
通用性強,生態成熟
Google Gemini Nano Banana
深度整合Google搜尋生態,擅長多媒體內容分析
Qwen-Image 2.0 Pro / Seedream 4.5
圖像生成質量高,長文本渲染能力突出
BAGEL / Ovis-U1 (開源)
統一多模態理解與生成能力較弱
訓練數據
商湯 SenseNova U1 (Lite 8B-MoT / A3B-MoT)
預訓練語料約2.1萬億token,全感官語料超3.4萬億token
OpenAI GPT Image 2 / ChatGPT Images 2.0
未明確提及
Google Gemini Nano Banana
從預訓練階段就接收多種模態數據
Qwen-Image 2.0 Pro / Seedream 4.5
未明確提及
BAGEL / Ovis-U1 (開源)
未明確提及
開源狀態
商湯 SenseNova U1 (Lite 8B-MoT / A3B-MoT)
全面開源 (Apache 2.0 協議)
OpenAI GPT Image 2 / ChatGPT Images 2.0
閉源
Google Gemini Nano Banana
閉源
Qwen-Image 2.0 Pro / Seedream 4.5
部分閉源或受限開源
BAGEL / Ovis-U1 (開源)
開源

技術深入

  • 核心架構: SenseNova U1基於商湯自主研發的NEO-unify原生統一架構。
  • 無編碼器設計: 徹底摒棄了傳統的視覺編碼器(VE)和變分自編碼器(VAE),直接將圖像和語言信息作為統一的複合體進行建模。
  • 統一表徵空間: 語言與視覺信息在模型內部每一層都進行深度融合,而非通過外部模塊拼接,實現高效協同,減少信息損耗。
  • 圖像輸入/輸出: 輸入端使用兩層卷積加GELU激活函數將圖像轉化為token(每個token對應32x32像素塊);輸出端直接使用MLP預測原始像素塊,無需VAE解碼器。
  • 訓練數據: 預訓練語料約2.1萬億token,涵蓋圖文對、圖注、信息圖理解和純文本,經過跨源去重、內容安全過濾、圖像質量過濾和CLIP比率平衡重標註等處理。總「全感官」語料超過3.4萬億token。
  • 四步訓練法:
    • 理解預熱 (Warmup): 基於預訓練NEO理解模型進行注意力融合與全模型繼續訓練,整合文本和圖像QK投影為統一共享佈局。
    • 生成預訓練: 凍結理解分支,專攻生成分支,在256到2048的動態分辨率下掌握圖像生成與編輯能力。
    • 統一中期訓練: 兩個分支同時激活,在理解、生成及圖文交錯混合下端到端聯合訓練84k步,實現模態間深度耦合。
    • 統一SFT: 在高質量指令執行數據上微調9k步,強化指令遵循能力。
  • 模型變體: SenseNova-U1-8B-MoT(基於稠密骨幹網絡)和SenseNova-U1-A3B-MoT(基於混合專家MoE骨幹網絡,30B-A3B參數,推理時激活3B)。
  • 效率優勢: NEO-Unify在更少的訓練token下取得更優性能,數據訓練效率顯著優於同類方法。引入分辨率自適應噪聲尺度,使不同分辨率下的像素空間生成更穩定。
  • MoT主幹: 採用原生Mixture-of-Transformers(MoT)主幹,實現高效且衝突較少的跨模態推理。
  • 應用潛力: 技術報告顯示,模型不僅限於感知與生成,在視覺-語言-動作(VLA)和世界模型(WM)場景中也表現強勁,指向機器人具身智能的發展。

前景展望基於引用來源的 AI 分析

SenseNova U1將加速具身智能和機器人技術的發展。
其深度理解物理世界佈局和關係的能力,結合統一架構,使其有望成為機器人的「具身大腦」,在單一模型閉環內完成感知、推理到執行全過程。
SenseNova U1的開源將推動多模態AI從「拼接」向「原生統一」範式轉變。
通過提供高效、統一的架構和模型權重,商湯鼓勵更廣泛的採用和創新,特別是在連續圖文創作和複雜信息圖生成等領域。
SenseNova U1的效率和對國產芯片的適配將促進AI的普及化和邊緣計算能力的提升。
其輕量級版本實現SOTA性能、較低的推理成本以及與十家國產芯片公司的適配,使其更適合部署於邊緣設備和移動終端,擴大AI的可及性。

時間線

2023-04
商湯科技發布「日日新SenseNova」大模型體系,涵蓋自然語言處理、內容生成等多種大模型。
2024-02
商湯科技發布「日日新SenseNova 4.0」,全面升級大模型體系,提升知識覆蓋、推理能力和長文本理解力。
2025-12
商湯科技發布SenseNova-SI系列模型,專注於空間智能,在多項評測中表現領先同量級開源模型。
2026-03
商湯自主研發NEO-unify架構,為SenseNova U1的發布奠定基礎。
2026-04-28
商湯科技正式發布並全面開源日日新SenseNova U1系列原生理解生成統一模型。
2026-05-06
商湯辦公小浣熊接入SenseNova U1模型,上線「一圖讀懂」功能,實現文本、長文檔和數據圖表自動生成信息圖。

來源 (35)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

1Google Search Sourcevertexaisearch.cloud.google.com2Google Search Sourcevertexaisearch.cloud.google.com3Google Search Sourcevertexaisearch.cloud.google.com4Google Search Sourcevertexaisearch.cloud.google.com5Google Search Sourcevertexaisearch.cloud.google.com6Google Search Sourcevertexaisearch.cloud.google.com7Google Search Sourcevertexaisearch.cloud.google.com8Google Search Sourcevertexaisearch.cloud.google.com9Google Search Sourcevertexaisearch.cloud.google.com10Google Search Sourcevertexaisearch.cloud.google.com11Google Search Sourcevertexaisearch.cloud.google.com12Google Search Sourcevertexaisearch.cloud.google.com13Google Search Sourcevertexaisearch.cloud.google.com14Google Search Sourcevertexaisearch.cloud.google.com15Google Search Sourcevertexaisearch.cloud.google.com16Google Search Sourcevertexaisearch.cloud.google.com17Google Search Sourcevertexaisearch.cloud.google.com18Google Search Sourcevertexaisearch.cloud.google.com19Google Search Sourcevertexaisearch.cloud.google.com20Google Search Sourcevertexaisearch.cloud.google.com21Google Search Sourcevertexaisearch.cloud.google.com22Google Search Sourcevertexaisearch.cloud.google.com23Google Search Sourcevertexaisearch.cloud.google.com24Google Search Sourcevertexaisearch.cloud.google.com25Google Search Sourcevertexaisearch.cloud.google.com26Google Search Sourcevertexaisearch.cloud.google.com27Google Search Sourcevertexaisearch.cloud.google.com28Google Search Sourcevertexaisearch.cloud.google.com29Google Search Sourcevertexaisearch.cloud.google.com30Google Search Sourcevertexaisearch.cloud.google.com31Google Search Sourcevertexaisearch.cloud.google.com32Google Search Sourcevertexaisearch.cloud.google.com33Google Search Sourcevertexaisearch.cloud.google.com34Google Search Sourcevertexaisearch.cloud.google.com35Google Search Sourcevertexaisearch.cloud.google.com

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。