🦙較早收集於 6h

Ovis2.6-80B-A3B:具備主動視覺能力的 MoE 多模態模型

Ovis2.6-80B-A3B:具備主動視覺能力的 MoE 多模態模型
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡一款高性能 MoE 多模態模型,透過主動操作圖像來提升推理準確度。

⚡ 30-Second TL;DR

有什麼變化

採用 MoE 架構,總參數 80B,活躍參數約 3B,實現高效服務。

為什麼重要

顯著降低了高性能多模態模型的服務成本,同時引入了主動認知視覺推理能力。

下一步行動

針對您的文件密集型視覺任務對 Ovis2.6 進行基準測試,觀察主動視覺推理是否比標準 MLLM 更能提升準確度。

誰應關注:Researchers & Academics

關鍵要點

  • 採用 MoE 架構,總參數 80B,活躍參數約 3B,實現高效服務。
  • 支援 64K 上下文視窗與 2880x2880 高解析度圖像處理。
  • 引入「圖像思考」功能,可主動調用裁切與旋轉等視覺工具。
  • 強化 OCR 與文件推理能力,適合複雜圖表分析。

🧠 深度解析

Web-grounded analysis with 14 cited sources.

🔑 增強重點摘要

  • Ovis2.6-80B-A3B 由阿里巴巴國際數字商務集團(AIDC-AI)開源,使其成為開源多模態大型語言模型領域的重要貢獻者。
  • 「圖像思考」(Think with Image)功能透過在推理過程中主動調用視覺工具(如裁剪和旋轉)來重新檢查和分析圖像區域,實現多輪、自我反思的視覺推理,顯著提高了複雜任務的準確性。
  • Ovis2.6 建立在 Ovis2.5 的基礎上,Ovis2.5 引入了原生解析度視覺轉換器(NaViT),能夠以原始、可變的解析度處理圖像,從而保留精細細節和整體佈局,這對於圖表和圖形等視覺密集型內容至關重要。
  • Ovis2.5 模型在訓練時不僅採用了線性思維鏈(Chain-of-Thought, CoT),還包含了反思性推理,例如自我檢查和修正,這在推理時可作為可選的「思考模式」以提高複雜輸入的準確性。
  • AIDC-AI 還開發了 Ovis-U1,這是一個 30 億參數的統一模型,它將多模態理解、文本到圖像生成和圖像編輯無縫整合到一個強大的框架中。
📊 競品分析▸ Show
模型/公司架構/參數關鍵功能圖像處理定價/基準
Ovis2.6-80B-A3B (AIDC-AI)MoE (總參數 80B, 活躍參數 ~3B)「圖像思考」(主動視覺工具)、64K 上下文、強化 OCR 與文件推理2880x2880 高解析度、主動裁剪/旋轉高性價比解決方案
OpenAI GPT-4o-文本、圖像、音訊、視訊感知;即時語音對話;情感表達語音輸出;多模態文件理解圖像解釋與文件理解-
Google Gemini 2.5 Flash & Pro-進階視覺語言推理;高效多輪對話;即時協作工具;可自訂 API圖像分析與修改;從圖像中提取文本Flash Image 定價:每百萬 token $30
Anthropic Claude 3.7-以安全為中心;深度上下文理解;PDF 和網路圖像分析的多模態聊天PDF 和網路圖像分析-
Zhipu AI GLM-4.5VMoE (總參數 106B, 活躍參數 12B)3D 旋轉位置編碼(3D-RoPE),增強 3D 空間關係感知與推理增強 3D 空間關係感知在 41 個公開多模態基準測試中達到 SOTA
Qwen3.5-397B-A17B (阿里巴巴)原生多模態 MoE (總參數 397B, 活躍參數 17B)混合門控 Delta 網路;超長上下文支援;高解碼吞吐量強大的視覺能力解碼吞吐量比 Qwen3-Max 高 8.6-19 倍
DeepSeek-V4 (DeepSeek AI)MoE (Pro: 總參數 1.6T, 活躍參數 49B; Flash: 總參數 284B, 活躍參數 13B)長上下文推理、編碼、代理工作流程;DeepSeek 稀疏注意力(DSA)加速長上下文處理--
Mistral PixtralMoE原生解析度;交錯數據處理;高效且可擴展原生解析度處理,無細節損失12B 模型適用於邊緣部署

🛠️ 技術深入

  • MoE 架構: Ovis2.6-80B-A3B 採用專家混合(MoE)架構,總參數達 800 億,但在單次推理時僅激活約 30 億參數,旨在實現卓越的多模態性能同時降低服務成本和提高吞吐量。
  • 上下文與解析度: 模型支援 64K token 的上下文視窗,並原生支援最高 2880x2880 像素的高解析度圖像輸入。
  • 「圖像思考」機制: 該功能將視覺從被動輸入轉變為主動認知工作空間。在推理過程中,模型可以主動調用內置視覺工具(例如裁剪和旋轉),在其思維鏈(Chain-of-Thought)中重新檢查和分析圖像區域,從而實現多輪、自我反思的視覺推理。
  • Ovis2.5 基礎架構: Ovis2.6 建立在 Ovis2.5 的基礎上,Ovis2.5 包含一個模組化堆疊,緊密耦合了原生解析度視覺轉換器(NaViT)、機率視覺嵌入表(VET)和一個大型語言模型(LLM)骨幹。
  • NaViT 視覺編碼器: NaViT 直接處理任意解析度的圖像,將其分割成不重疊的圖像塊,透過 ViT 將每個圖像塊映射到連續特徵,並透過參數化的 softmax 和嵌入查找機制將這些特徵轉換為離散的「視覺 token」。這些視覺 token 在維度和結構上與 LLM 的文本嵌入線性對齊。
  • 效率優化(Ovis2.5): Ovis2.5 採用 BF16 精度與激活檢查點(activation checkpointing)以最小化 GPU 記憶體峰值,並利用 FlashAttention 進行大 token 序列的高效 softmax 計算。其設計支援在單個高階 GPU 上進行推理。
  • 訓練方法(Ovis2.5): Ovis2.5 不僅在線性思維鏈(CoT)上進行訓練,還在反思性推理(包括自我檢查和修正)上進行訓練,這在推理時可作為可選的「思考模式」以提高複雜輸入的準確性。
  • Ovis-U1 架構: Ovis-U1 具有一個強大的基於擴散的視覺解碼器(MMDiT)和一個雙向 token 精煉器,可實現高保真圖像合成並增強文本與視覺之間的互動。它透過理解、生成和編輯數據的協同統一訓練來提高泛化能力。

🔮 前景展望AI analysis grounded in cited sources

「圖像思考」能力將重新定義多模態 AI 的互動模式。
透過允許模型在推理過程中主動操作視覺輸入,它超越了被動理解,實現了更接近人類的分析過程,從而開闢了新的應用場景。
MoE 架構與高總參數、低活躍參數的結合將推動先進多模態模型部署的成本效益。
這種設計在提供強大推理能力的同時,有效控制了推理成本,將加速多模態 AI 在企業級應用中的廣泛採用。
AIDC-AI 的開源策略將加速多模態 AI 社區的創新步伐。
提供 Ovis2.6 等先進模型的開源存取權限,將使研究人員和開發者能夠在此基礎上進行開發和貢獻,從而促進技術的快速進步和普及。

時間線

2025-06-28
AIDC-AI 發布 Ovis-U1-3B,一個整合多模態理解、文本到圖像生成和圖像編輯的統一模型。
2025-08-15
AIDC-AI 發布 Ovis2.5(2B 和 9B 參數版本),引入原生解析度視覺感知和增強的多模態推理能力,並在 OpenCompass 多模態評估套件中取得領先成績。
2025-11-29
AIDC-AI 發布 Ovis-Image,一個 7B 文本到圖像模型,專門針對高品質文本渲染進行優化。
2026-05-13
AIDC-AI 開源 Ovis2.6-80B-A3B,該模型採用 MoE 架構並具備「圖像思考」能力。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA