商湯科技發布開源SenseNova U1系列模型
商湯科技正式發布並開源日日新SenseNova U1系列原生理解生成統一模型。基於今年三月自主研發的NEO-unify架構,在單一模型架構上統一多模態理解、推理與生成。該模型將語言與視覺資訊作為統一複合體直接建模,實現高效協同,保留語義豐富度並維持像素級視覺保真度。
Tag: #vision-language20 results
商湯科技正式發布並開源日日新SenseNova U1系列原生理解生成統一模型。基於今年三月自主研發的NEO-unify架構,在單一模型架構上統一多模態理解、推理與生成。該模型將語言與視覺資訊作為統一複合體直接建模,實現高效協同,保留語義豐富度並維持像素級視覺保真度。
ColQwen3.5-v2 4.5B 是基於 Qwen3.5-4B 的全新視覺文件檢索模型,在 ViDoRe V3 nDCG@10 達到 0.6177 的頂尖成績。採用簡化 2 階段訓練配方,整合硬負樣本與領域數據。在 Hugging Face 上以 Apache 2.0 釋出。

Om AI 推出端側原生 VLX 模型,目標是以較少參數實現對物理世界的精準感知。文章將其定位為 3B 規模模型,並主張產業進步不應只依賴堆疊算力,而應採用更適合新環境的架構。

MARCH 是一個多代理框架,模擬放射科部門階層來生成精確的 3D CT 報告,解決 VLM 中的幻覺問題。它包含駐院醫師代理負責初稿、同儕代理負責修訂,以及主治醫師代理負責共識。於 RadGenome-ChestCT 資料集上超越 SOTA 在臨床忠實度和語言準確性。

ViSA-R2 使用模擬物理學家推理的自驗證思考鏈,從二維線性穩態場域視覺化中恢復解析 SymPy 表達式。它引入 ViSA-Bench,一個包含 30 個可驗證情境的合成基準,用於 VLM 評估。基於 8B Qwen3-VL,表現優於開源基準和前沿 VLM。

中國團隊打造首個大規模超聲專屬數據集,包含36.4萬圖文對。此數據集讓AI真正理解超聲影像的臨床診斷語義。入選CVPR’26,標誌超聲AI邁入大模型時代。
Hugging Face 發布 Granite 4.0 3B Vision,這是一款專為企業文件設計的緊湊多模態模型。它提供高效的視覺語言智能,適用於商業應用。該模型現已在 Hugging Face 平台上線。

Ricoh 開發了 Qwen3-VL-Ricoh-32B-20260227,這是一款擁有 320 億參數的多模態 LLM,能以日語進行推論。宣稱性能匹敵 Gemini 2.5 Pro,並可讀解包含複雜圖表的日語資料。

RAMP-3D 使用僅 RGB-D 觀測,從不完整語言目標實現長時程 3D 箱子重排。它依序預測配對 3D 遮罩,指定「挑取物件」與「放置目標區域」。在 11 種倉庫任務(1-30 箱)達 79.5% 成功率,大幅優於 2D VLM 基準。

浙江大學團隊解決多模態模型「盲目自信」問題,即模型對模糊圖像仍自信滿滿。先校準置信度,再動態分配算力。獲CVPR 2026接收。