來源量子位•較早收集於 3h
MiniMax M3 手測:多模態推理能力實測

💡中國多模態模型能處理複雜的 Nvidia 簡報嗎?看看 MiniMax M3 在實際視覺測試中的表現。
⚡ 30 秒速覽
有什麼變化
針對複雜的 Nvidia 簡報進行 MiniMax M3 實測
為什麼重要
顯示中國多模態模型在競爭全球頂尖基準測試方面的快速進步。這表明在視覺理解任務上的差距正在縮小。
下一步行動
評估 MiniMax M3 的 API 以應用於您的特定視覺提取工作流程,並與 GPT-4o 進行比較。
誰應關注:Developers & AI Engineers
關鍵要點
- •針對複雜的 Nvidia 簡報進行 MiniMax M3 實測
- •評估視覺辨識與推理效能
- •展示處理高密度視覺資料的能力
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 15 個來源。
🔑 增強重點摘要
- •MiniMax M3 聲稱是首個結合了前沿編碼、百萬級上下文窗口和原生多模態能力的開源模型,儘管其權重尚未完全發布以供獨立驗證。
- •M3 採用專有的 MiniMax 稀疏注意力(MSA)架構,該架構透過兩階段機制顯著降低了長上下文處理的計算成本,使其每 token 計算量僅為前一代 M2 的 1/20。
- •該模型在編碼和代理任務方面表現出色,在 SWE-Bench Pro 等基準測試中超越了 GPT-5.5 和 Gemini 3.1 Pro,並在 BrowseComp 網頁瀏覽基準測試中超越了 Claude Opus 4.7。
- •M3 支援文字、圖像和影片輸入,並能操作桌面電腦,展現了其在複雜代理工作流程中的應用潛力,例如自主重現研究論文實驗或優化 NVIDIA Hopper GPU 核心。
📊 競品分析▸ Show
| 模型名稱 | 多模態能力 | 上下文窗口 | 開源狀態 | SWE-Bench Pro (編碼) | BrowseComp (網頁瀏覽) | Terminal-Bench 2.1 (終端執行) | API 定價 (每百萬 token) |
|---|---|---|---|---|---|---|---|
| MiniMax M3 | 文字、圖像、影片、桌面操作 | 1M tokens (保證 512K) | 聲稱開源 (權重待發布) | 59.0% | 83.5% | 66.0% | 輸入 $0.30 / 輸出 $1.20 (促銷價) |
| Anthropic Claude Opus 4.8 | 通用多模態 | 長上下文 (具體數值未提供) | 閉源 | 69.2% (Opus 4.8) | 79.3% (Opus 4.7) | 74.6% (Opus 4.8) | 通常較高 |
| OpenAI GPT-5.5 | 通用多模態 (GPT-5.4 支援視覺+音訊、電腦操作) | 未明確提供 | 閉源 | 58.6% | 未明確提供 | 未明確提供 | 通常較高 |
| Google Gemini 3.1 Pro | 文字、圖像、影片、音訊 | 1M tokens (Gemini 3.5 Flash) | 閉源 | 54.2% | 未明確提供 | 未明確提供 | 通常較高 |
🛠️ 技術深入
- MiniMax 稀疏注意力 (MSA) 架構:
- 取代標準 Transformer 模型中計算複雜度呈二次方增長的注意力機制,以解決長上下文處理的成本問題。
- 採用兩階段機制:輕量級索引分支首先掃描輸入 token 並選擇相關的鍵值 (KV) 緩存區塊,然後僅對這些選定的區塊執行昂貴的注意力計算。
- 在百萬級 token 上下文長度下,每 token 計算量降至前一代 M2 的 1/20。
- 據 MiniMax 報告,輸入處理速度提升約 9.7 倍,響應生成速度提升約 15.6 倍(在完整上下文長度下)。
- 與 DeepSeek 的多頭潛在注意力不同,MSA 在未壓縮的鍵值數據上操作,公司聲稱這避免了長上下文中的精度損失。
- 原生多模態訓練:
- M3 是從「零步驟」開始進行混合模態訓練的原生多模態模型,而非將預訓練的文本網絡與單獨的視覺模型融合。
- MiniMax 重組了整個數據管線,將預訓練數據擴展到數百 TB,實現了文本和視覺語義空間的深度對齊。
- 上下文窗口:
- 支援高達 100 萬 token 的上下文窗口,並保證至少 512K token,為長程代理任務、長程編碼和長影片理解提供基礎設施。
🔮 前景展望基於引用來源的 AI 分析
開源多模態模型將加速 AI 創新與普及。
MiniMax M3 作為首個結合前沿編碼、百萬級上下文和原生多模態能力的開源模型,降低了尖端 AI 技術的門檻,鼓勵更廣泛的開發者社區參與創新。
AI 代理的自主執行能力將大幅提升。
M3 在自主重現研究論文和優化 GPU 核心等任務中展現的長程自主執行能力,預示著 AI 代理在複雜、多步驟任務中的應用將更加廣泛和高效。
稀疏注意力機制將成為長上下文 AI 模型的主流技術。
MiniMax 稀疏注意力 (MSA) 顯著降低了長上下文處理的計算成本並提升了速度,使其成為實現經濟高效的百萬級 token 上下文窗口的關鍵技術,其他領先模型也採用了類似方法。
⏳ 時間線
2021-12
MiniMax 成立
2022-10
推出 Glow 應用程式 (後更名為 Talkie)
2024-03
阿里巴巴集團領投 6 億美元融資,公司估值達 25 億美元
2025-01
推出 MiniMax-01 LLM 產品線,包括 MiniMax-Text-01 和 MiniMax-VL-01
2025-10
推出 MiniMax M2 模型
2026-01
MiniMax 在香港證券交易所上市
2026-03
推出 MiniMax M2.7 模型
2026-06
推出 MiniMax M3 模型
📎 來源 (15)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗
每週電子報
每週一封,可隨時退訂。