🦙Reddit r/LocalLLaMA•較早收集於 6h
Ovis2.6-80B-A3B:具備主動視覺能力的 MoE 多模態模型

💡一款高性能 MoE 多模態模型,透過主動操作圖像來提升推理準確度。
⚡ 30-Second TL;DR
有什麼變化
採用 MoE 架構,總參數 80B,活躍參數約 3B,實現高效服務。
為什麼重要
顯著降低了高性能多模態模型的服務成本,同時引入了主動認知視覺推理能力。
下一步行動
針對您的文件密集型視覺任務對 Ovis2.6 進行基準測試,觀察主動視覺推理是否比標準 MLLM 更能提升準確度。
誰應關注:Researchers & Academics
關鍵要點
- •採用 MoE 架構,總參數 80B,活躍參數約 3B,實現高效服務。
- •支援 64K 上下文視窗與 2880x2880 高解析度圖像處理。
- •引入「圖像思考」功能,可主動調用裁切與旋轉等視覺工具。
- •強化 OCR 與文件推理能力,適合複雜圖表分析。
🧠 深度解析
Web-grounded analysis with 14 cited sources.
🔑 增強重點摘要
- •Ovis2.6-80B-A3B 由阿里巴巴國際數字商務集團(AIDC-AI)開源,使其成為開源多模態大型語言模型領域的重要貢獻者。
- •「圖像思考」(Think with Image)功能透過在推理過程中主動調用視覺工具(如裁剪和旋轉)來重新檢查和分析圖像區域,實現多輪、自我反思的視覺推理,顯著提高了複雜任務的準確性。
- •Ovis2.6 建立在 Ovis2.5 的基礎上,Ovis2.5 引入了原生解析度視覺轉換器(NaViT),能夠以原始、可變的解析度處理圖像,從而保留精細細節和整體佈局,這對於圖表和圖形等視覺密集型內容至關重要。
- •Ovis2.5 模型在訓練時不僅採用了線性思維鏈(Chain-of-Thought, CoT),還包含了反思性推理,例如自我檢查和修正,這在推理時可作為可選的「思考模式」以提高複雜輸入的準確性。
- •AIDC-AI 還開發了 Ovis-U1,這是一個 30 億參數的統一模型,它將多模態理解、文本到圖像生成和圖像編輯無縫整合到一個強大的框架中。
📊 競品分析▸ Show
| 模型/公司 | 架構/參數 | 關鍵功能 | 圖像處理 | 定價/基準 |
|---|---|---|---|---|
| Ovis2.6-80B-A3B (AIDC-AI) | MoE (總參數 80B, 活躍參數 ~3B) | 「圖像思考」(主動視覺工具)、64K 上下文、強化 OCR 與文件推理 | 2880x2880 高解析度、主動裁剪/旋轉 | 高性價比解決方案 |
| OpenAI GPT-4o | - | 文本、圖像、音訊、視訊感知;即時語音對話;情感表達語音輸出;多模態文件理解 | 圖像解釋與文件理解 | - |
| Google Gemini 2.5 Flash & Pro | - | 進階視覺語言推理;高效多輪對話;即時協作工具;可自訂 API | 圖像分析與修改;從圖像中提取文本 | Flash Image 定價:每百萬 token $30 |
| Anthropic Claude 3.7 | - | 以安全為中心;深度上下文理解;PDF 和網路圖像分析的多模態聊天 | PDF 和網路圖像分析 | - |
| Zhipu AI GLM-4.5V | MoE (總參數 106B, 活躍參數 12B) | 3D 旋轉位置編碼(3D-RoPE),增強 3D 空間關係感知與推理 | 增強 3D 空間關係感知 | 在 41 個公開多模態基準測試中達到 SOTA |
| Qwen3.5-397B-A17B (阿里巴巴) | 原生多模態 MoE (總參數 397B, 活躍參數 17B) | 混合門控 Delta 網路;超長上下文支援;高解碼吞吐量 | 強大的視覺能力 | 解碼吞吐量比 Qwen3-Max 高 8.6-19 倍 |
| DeepSeek-V4 (DeepSeek AI) | MoE (Pro: 總參數 1.6T, 活躍參數 49B; Flash: 總參數 284B, 活躍參數 13B) | 長上下文推理、編碼、代理工作流程;DeepSeek 稀疏注意力(DSA)加速長上下文處理 | - | - |
| Mistral Pixtral | MoE | 原生解析度;交錯數據處理;高效且可擴展 | 原生解析度處理,無細節損失 | 12B 模型適用於邊緣部署 |
🛠️ 技術深入
- MoE 架構: Ovis2.6-80B-A3B 採用專家混合(MoE)架構,總參數達 800 億,但在單次推理時僅激活約 30 億參數,旨在實現卓越的多模態性能同時降低服務成本和提高吞吐量。
- 上下文與解析度: 模型支援 64K token 的上下文視窗,並原生支援最高 2880x2880 像素的高解析度圖像輸入。
- 「圖像思考」機制: 該功能將視覺從被動輸入轉變為主動認知工作空間。在推理過程中,模型可以主動調用內置視覺工具(例如裁剪和旋轉),在其思維鏈(Chain-of-Thought)中重新檢查和分析圖像區域,從而實現多輪、自我反思的視覺推理。
- Ovis2.5 基礎架構: Ovis2.6 建立在 Ovis2.5 的基礎上,Ovis2.5 包含一個模組化堆疊,緊密耦合了原生解析度視覺轉換器(NaViT)、機率視覺嵌入表(VET)和一個大型語言模型(LLM)骨幹。
- NaViT 視覺編碼器: NaViT 直接處理任意解析度的圖像,將其分割成不重疊的圖像塊,透過 ViT 將每個圖像塊映射到連續特徵,並透過參數化的 softmax 和嵌入查找機制將這些特徵轉換為離散的「視覺 token」。這些視覺 token 在維度和結構上與 LLM 的文本嵌入線性對齊。
- 效率優化(Ovis2.5): Ovis2.5 採用 BF16 精度與激活檢查點(activation checkpointing)以最小化 GPU 記憶體峰值,並利用 FlashAttention 進行大 token 序列的高效 softmax 計算。其設計支援在單個高階 GPU 上進行推理。
- 訓練方法(Ovis2.5): Ovis2.5 不僅在線性思維鏈(CoT)上進行訓練,還在反思性推理(包括自我檢查和修正)上進行訓練,這在推理時可作為可選的「思考模式」以提高複雜輸入的準確性。
- Ovis-U1 架構: Ovis-U1 具有一個強大的基於擴散的視覺解碼器(MMDiT)和一個雙向 token 精煉器,可實現高保真圖像合成並增強文本與視覺之間的互動。它透過理解、生成和編輯數據的協同統一訓練來提高泛化能力。
🔮 前景展望AI analysis grounded in cited sources
「圖像思考」能力將重新定義多模態 AI 的互動模式。
透過允許模型在推理過程中主動操作視覺輸入,它超越了被動理解,實現了更接近人類的分析過程,從而開闢了新的應用場景。
MoE 架構與高總參數、低活躍參數的結合將推動先進多模態模型部署的成本效益。
這種設計在提供強大推理能力的同時,有效控制了推理成本,將加速多模態 AI 在企業級應用中的廣泛採用。
AIDC-AI 的開源策略將加速多模態 AI 社區的創新步伐。
提供 Ovis2.6 等先進模型的開源存取權限,將使研究人員和開發者能夠在此基礎上進行開發和貢獻,從而促進技術的快速進步和普及。
⏳ 時間線
2025-06-28
AIDC-AI 發布 Ovis-U1-3B,一個整合多模態理解、文本到圖像生成和圖像編輯的統一模型。
2025-08-15
AIDC-AI 發布 Ovis2.5(2B 和 9B 參數版本),引入原生解析度視覺感知和增強的多模態推理能力,並在 OpenCompass 多模態評估套件中取得領先成績。
2025-11-29
AIDC-AI 發布 Ovis-Image,一個 7B 文本到圖像模型,專門針對高品質文本渲染進行優化。
2026-05-13
AIDC-AI 開源 Ovis2.6-80B-A3B,該模型採用 MoE 架構並具備「圖像思考」能力。
📎 來源 (14)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗