來源Reddit r/LocalLLaMA•較早收集於 6h
Ovis2.6-80B-A3B:具備主動視覺能力的 MoE 多模態模型

一款高性能 MoE 多模態模型,透過主動操作圖像來提升推理準確度。
30 秒速覽
有什麼變化
採用 MoE 架構,總參數 80B,活躍參數約 3B,實現高效服務。
為什麼重要
顯著降低了高性能多模態模型的服務成本,同時引入了主動認知視覺推理能力。
下一步行動
針對您的文件密集型視覺任務對 Ovis2.6 進行基準測試,觀察主動視覺推理是否比標準 MLLM 更能提升準確度。
誰應關注:Researchers & Academics
關鍵要點
- •採用 MoE 架構,總參數 80B,活躍參數約 3B,實現高效服務。
- •支援 64K 上下文視窗與 2880x2880 高解析度圖像處理。
- •引入「圖像思考」功能,可主動調用裁切與旋轉等視覺工具。
- •強化 OCR 與文件推理能力,適合複雜圖表分析。
深度解析
背景與延伸:來自公開資料,非原文內容。引用 14 個來源。
增強重點摘要
- •Ovis2.6-80B-A3B 由阿里巴巴國際數字商務集團(AIDC-AI)開源,使其成為開源多模態大型語言模型領域的重要貢獻者。
- •「圖像思考」(Think with Image)功能透過在推理過程中主動調用視覺工具(如裁剪和旋轉)來重新檢查和分析圖像區域,實現多輪、自我反思的視覺推理,顯著提高了複雜任務的準確性。
- •Ovis2.6 建立在 Ovis2.5 的基礎上,Ovis2.5 引入了原生解析度視覺轉換器(NaViT),能夠以原始、可變的解析度處理圖像,從而保留精細細節和整體佈局,這對於圖表和圖形等視覺密集型內容至關重要。
- •Ovis2.5 模型在訓練時不僅採用了線性思維鏈(Chain-of-Thought, CoT),還包含了反思性推理,例如自我檢查和修正,這在推理時可作為可選的「思考模式」以提高複雜輸入的準確性。
- •AIDC-AI 還開發了 Ovis-U1,這是一個 30 億參數的統一模型,它將多模態理解、文本到圖像生成和圖像編輯無縫整合到一個強大的框架中。
競品分析
Ovis2.6-80B-A3B (AIDC-AI)
- 架構/參數
- MoE (總參數 80B, 活躍參數 ~3B)
- 關鍵功能
- 「圖像思考」(主動視覺工具)、64K 上下文、強化 OCR 與文件推理
- 圖像處理
- 2880x2880 高解析度、主動裁剪/旋轉
- 定價/基準
- 高性價比解決方案
OpenAI GPT-4o
- 架構/參數
- 關鍵功能
- 文本、圖像、音訊、視訊感知;即時語音對話;情感表達語音輸出;多模態文件理解
- 圖像處理
- 圖像解釋與文件理解
- 定價/基準
Google Gemini 2.5 Flash & Pro
- 架構/參數
- 關鍵功能
- 進階視覺語言推理;高效多輪對話;即時協作工具;可自訂 API
- 圖像處理
- 圖像分析與修改;從圖像中提取文本
- 定價/基準
- Flash Image 定價:每百萬 token $30
Anthropic Claude 3.7
- 架構/參數
- 關鍵功能
- 以安全為中心;深度上下文理解;PDF 和網路圖像分析的多模態聊天
- 圖像處理
- PDF 和網路圖像分析
- 定價/基準
Zhipu AI GLM-4.5V
- 架構/參數
- MoE (總參數 106B, 活躍參數 12B)
- 關鍵功能
- 3D 旋轉位置編碼(3D-RoPE),增強 3D 空間關係感知與推理
- 圖像處理
- 增強 3D 空間關係感知
- 定價/基準
- 在 41 個公開多模態基準測試中達到 SOTA
Qwen3.5-397B-A17B (阿里巴巴)
- 架構/參數
- 原生多模態 MoE (總參數 397B, 活躍參數 17B)
- 關鍵功能
- 混合門控 Delta 網路;超長上下文支援;高解碼吞吐量
- 圖像處理
- 強大的視覺能力
- 定價/基準
- 解碼吞吐量比 Qwen3-Max 高 8.6-19 倍
DeepSeek-V4 (DeepSeek AI)
- 架構/參數
- MoE (Pro: 總參數 1.6T, 活躍參數 49B; Flash: 總參數 284B, 活躍參數 13B)
- 關鍵功能
- 長上下文推理、編碼、代理工作流程;DeepSeek 稀疏注意力(DSA)加速長上下文處理
- 圖像處理
- 定價/基準
Mistral Pixtral
- 架構/參數
- MoE
- 關鍵功能
- 原生解析度;交錯數據處理;高效且可擴展
- 圖像處理
- 原生解析度處理,無細節損失
- 定價/基準
- 12B 模型適用於邊緣部署
| 模型/公司 | 架構/參數 | 關鍵功能 | 圖像處理 | 定價/基準 |
|---|---|---|---|---|
| Ovis2.6-80B-A3B (AIDC-AI) | MoE (總參數 80B, 活躍參數 ~3B) | 「圖像思考」(主動視覺工具)、64K 上下文、強化 OCR 與文件推理 | 2880x2880 高解析度、主動裁剪/旋轉 | 高性價比解決方案 |
| OpenAI GPT-4o | 文本、圖像、音訊、視訊感知;即時語音對話;情感表達語音輸出;多模態文件理解 | 圖像解釋與文件理解 | ||
| Google Gemini 2.5 Flash & Pro | 進階視覺語言推理;高效多輪對話;即時協作工具;可自訂 API | 圖像分析與修改;從圖像中提取文本 | Flash Image 定價:每百萬 token $30 | |
| Anthropic Claude 3.7 | 以安全為中心;深度上下文理解;PDF 和網路圖像分析的多模態聊天 | PDF 和網路圖像分析 | ||
| Zhipu AI GLM-4.5V | MoE (總參數 106B, 活躍參數 12B) | 3D 旋轉位置編碼(3D-RoPE),增強 3D 空間關係感知與推理 | 增強 3D 空間關係感知 | 在 41 個公開多模態基準測試中達到 SOTA |
| Qwen3.5-397B-A17B (阿里巴巴) | 原生多模態 MoE (總參數 397B, 活躍參數 17B) | 混合門控 Delta 網路;超長上下文支援;高解碼吞吐量 | 強大的視覺能力 | 解碼吞吐量比 Qwen3-Max 高 8.6-19 倍 |
| DeepSeek-V4 (DeepSeek AI) | MoE (Pro: 總參數 1.6T, 活躍參數 49B; Flash: 總參數 284B, 活躍參數 13B) | 長上下文推理、編碼、代理工作流程;DeepSeek 稀疏注意力(DSA)加速長上下文處理 | ||
| Mistral Pixtral | MoE | 原生解析度;交錯數據處理;高效且可擴展 | 原生解析度處理,無細節損失 | 12B 模型適用於邊緣部署 |
技術深入
- MoE 架構: Ovis2.6-80B-A3B 採用專家混合(MoE)架構,總參數達 800 億,但在單次推理時僅激活約 30 億參數,旨在實現卓越的多模態性能同時降低服務成本和提高吞吐量。
- 上下文與解析度: 模型支援 64K token 的上下文視窗,並原生支援最高 2880x2880 像素的高解析度圖像輸入。
- 「圖像思考」機制: 該功能將視覺從被動輸入轉變為主動認知工作空間。在推理過程中,模型可以主動調用內置視覺工具(例如裁剪和旋轉),在其思維鏈(Chain-of-Thought)中重新檢查和分析圖像區域,從而實現多輪、自我反思的視覺推理。
- Ovis2.5 基礎架構: Ovis2.6 建立在 Ovis2.5 的基礎上,Ovis2.5 包含一個模組化堆疊,緊密耦合了原生解析度視覺轉換器(NaViT)、機率視覺嵌入表(VET)和一個大型語言模型(LLM)骨幹。
- NaViT 視覺編碼器: NaViT 直接處理任意解析度的圖像,將其分割成不重疊的圖像塊,透過 ViT 將每個圖像塊映射到連續特徵,並透過參數化的 softmax 和嵌入查找機制將這些特徵轉換為離散的「視覺 token」。這些視覺 token 在維度和結構上與 LLM 的文本嵌入線性對齊。
- 效率優化(Ovis2.5): Ovis2.5 採用 BF16 精度與激活檢查點(activation checkpointing)以最小化 GPU 記憶體峰值,並利用 FlashAttention 進行大 token 序列的高效 softmax 計算。其設計支援在單個高階 GPU 上進行推理。
- 訓練方法(Ovis2.5): Ovis2.5 不僅在線性思維鏈(CoT)上進行訓練,還在反思性推理(包括自我檢查和修正)上進行訓練,這在推理時可作為可選的「思考模式」以提高複雜輸入的準確性。
- Ovis-U1 架構: Ovis-U1 具有一個強大的基於擴散的視覺解碼器(MMDiT)和一個雙向 token 精煉器,可實現高保真圖像合成並增強文本與視覺之間的互動。它透過理解、生成和編輯數據的協同統一訓練來提高泛化能力。
前景展望基於引用來源的 AI 分析
「圖像思考」能力將重新定義多模態 AI 的互動模式。
透過允許模型在推理過程中主動操作視覺輸入,它超越了被動理解,實現了更接近人類的分析過程,從而開闢了新的應用場景。
MoE 架構與高總參數、低活躍參數的結合將推動先進多模態模型部署的成本效益。
這種設計在提供強大推理能力的同時,有效控制了推理成本,將加速多模態 AI 在企業級應用中的廣泛採用。
AIDC-AI 的開源策略將加速多模態 AI 社區的創新步伐。
提供 Ovis2.6 等先進模型的開源存取權限,將使研究人員和開發者能夠在此基礎上進行開發和貢獻,從而促進技術的快速進步和普及。
時間線
2025-06-28
AIDC-AI 發布 Ovis-U1-3B,一個整合多模態理解、文本到圖像生成和圖像編輯的統一模型。
2025-08-15
AIDC-AI 發布 Ovis2.5(2B 和 9B 參數版本),引入原生解析度視覺感知和增強的多模態推理能力,並在 OpenCompass 多模態評估套件中取得領先成績。
2025-11-29
AIDC-AI 發布 Ovis-Image,一個 7B 文本到圖像模型,專門針對高品質文本渲染進行優化。
2026-05-13
AIDC-AI 開源 Ovis2.6-80B-A3B,該模型採用 MoE 架構並具備「圖像思考」能力。
- 2025-06-28AIDC-AI 發布 Ovis-U1-3B,一個整合多模態理解、文本到圖像生成和圖像編輯的統一模型。
- 2025-08-15AIDC-AI 發布 Ovis2.5(2B 和 9B 參數版本),引入原生解析度視覺感知和增強的多模態推理能力,並在 OpenCompass 多模態評估套件中取得領先成績。
- 2025-11-29AIDC-AI 發布 Ovis-Image,一個 7B 文本到圖像模型,專門針對高品質文本渲染進行優化。
- 2026-05-13AIDC-AI 開源 Ovis2.6-80B-A3B,該模型採用 MoE 架構並具備「圖像思考」能力。
來源 (14)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
1Google Search Sourcevertexaisearch.cloud.google.com2Google Search Sourcevertexaisearch.cloud.google.com3Google Search Sourcevertexaisearch.cloud.google.com4Google Search Sourcevertexaisearch.cloud.google.com5Google Search Sourcevertexaisearch.cloud.google.com6Google Search Sourcevertexaisearch.cloud.google.com7Google Search Sourcevertexaisearch.cloud.google.com8Google Search Sourcevertexaisearch.cloud.google.com9Google Search Sourcevertexaisearch.cloud.google.com10Google Search Sourcevertexaisearch.cloud.google.com11Google Search Sourcevertexaisearch.cloud.google.com12Google Search Sourcevertexaisearch.cloud.google.com13Google Search Sourcevertexaisearch.cloud.google.com14Google Search Sourcevertexaisearch.cloud.google.com
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週電子報
每週一封,可隨時退訂。