⚛️較早收集於 22m

商湯摒棄VAE/VE,重構多模態架構

商湯摒棄VAE/VE,重構多模態架構
PostLinkedIn
⚛️閱讀原文: 量子位
#multimodal#model-architecture#encoder-freesensetime-multimodalsensetimevaeve

💡商湯2B多模態淘汰VAE/VE開銷—高效模型新範式?(22字元)

⚡ 30-Second TL;DR

有什麼變化

摒棄VE與VAE,實現直接多模態處理

為什麼重要

此突破實現更高效的小規模多模態模型,有望降低訓練成本並加速實際應用推理。

下一步行動

檢閱量子位上的商湯技術報告,獲取架構圖與基準數據。

誰應關注:Researchers & Academics

關鍵要點

  • 摒棄VE與VAE,實現直接多模態處理
  • 移除所有中間編碼器,降低複雜度
  • 2B規模模型大幅超越傳統方法

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • 商湯「日日新」融合大模型在OpenCompass多模態評測中以同一模型奪得榜單第一,分數大幅領先GPT-4o,實現原生融合模態訓練突破。[1]
  • 商湯開源SenseNova-MARS多模態自主推理模型(8B/32B版本),在多模態搜索與推理基準測試中得分69.74超越Gemini-3-Pro與GPT-5.2,支持動態視覺推理與圖文搜索深度融合。[3]
  • 商湯日日新SenseNova 5.0首創港式粵語AI大模型,通曉本地文化,在知識、推理等評測勝過GPT-4 Turbo,並支持多模態智能助手解析PDF等多格式檔案。[5]
📊 競品分析▸ Show
模型參數規模多模態基準表現開源狀態
SenseNova-MARS8B/32B多模態搜索推理69.74(勝Gemini-3-Pro 69.06、GPT-5.2 67.64)[3]開源
日日新融合大模型未明OpenCompass榜首(領先GPT-4o)[1]未開源
GPT-4o未明OpenCompass落後日日新[1]閉源
Gemini-3-Pro未明多模態搜索推理69.06(落後MARS)[3]閉源

🛠️ 技術深入

  • 日日新SenseNova大模型體系包含商量SenseChat千億級語言模型,支持200K超長上下文與原生多模態融合。[6]
  • 融合模態數據合成與融合任務增強訓練技術,用於後訓練階段構建跨模態任務如視頻交互、多模態文檔分析、城市與車載場景理解。[1]
  • SenseNova-MARS為首個支持動態視覺推理與圖文搜索深度融合的Agentic VLM模型,能自主規劃步驟、調用工具處理複雜任務。[3]
  • 商量粵語API最大支援128K窗口,以100萬Tokens計算輸入輸出收費各30港元,支持上傳50個文檔解析統計圖與總結內容。[5]

🔮 前景展望AI analysis grounded in cited sources

商湯原生融合模態將加速業界從分立模型走向真正模型合一
日日新模型率先在權威評測中領先GPT-4o,證明融合模態訓練取得實質突破,引領多模態交互向世界模型演進。[1]
開源SenseNova-MARS將推動多模態Agentic VLM廣泛應用
其超越Gemini-3-Pro與GPT-5.2的搜索推理能力,支持自主工具調用,將降低開發門檻並提升AI執行力。[3]

時間線

2025-01
推出「日日新」融合大模型,奪OpenCompass多模態評測雙冠王領先GPT-4o
2025-12
發布日日新SenseNova 5.0,首創港式粵語AI大模型勝GPT-4 Turbo
2026-01
開源SenseNova-MARS(8B/32B),多模態搜索推理基準超越Gemini-3-Pro
2026-01
日日新V6.5奪多模態大模型2025年度收官戰國內第一
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。