⚛️較早收集於 3h

MiniMax M3 手測:多模態推理能力實測

MiniMax M3 手測:多模態推理能力實測
PostLinkedIn
⚛️閱讀原文: 量子位

💡中國多模態模型能處理複雜的 Nvidia 簡報嗎?看看 MiniMax M3 在實際視覺測試中的表現。

⚡ 30-Second TL;DR

有什麼變化

針對複雜的 Nvidia 簡報進行 MiniMax M3 實測

為什麼重要

顯示中國多模態模型在競爭全球頂尖基準測試方面的快速進步。這表明在視覺理解任務上的差距正在縮小。

下一步行動

評估 MiniMax M3 的 API 以應用於您的特定視覺提取工作流程,並與 GPT-4o 進行比較。

誰應關注:Developers & AI Engineers

關鍵要點

  • 針對複雜的 Nvidia 簡報進行 MiniMax M3 實測
  • 評估視覺辨識與推理效能
  • 展示處理高密度視覺資料的能力

🧠 深度解析

Web-grounded analysis with 15 cited sources.

🔑 增強重點摘要

  • MiniMax M3 聲稱是首個結合了前沿編碼、百萬級上下文窗口和原生多模態能力的開源模型,儘管其權重尚未完全發布以供獨立驗證。
  • M3 採用專有的 MiniMax 稀疏注意力(MSA)架構,該架構透過兩階段機制顯著降低了長上下文處理的計算成本,使其每 token 計算量僅為前一代 M2 的 1/20。
  • 該模型在編碼和代理任務方面表現出色,在 SWE-Bench Pro 等基準測試中超越了 GPT-5.5 和 Gemini 3.1 Pro,並在 BrowseComp 網頁瀏覽基準測試中超越了 Claude Opus 4.7。
  • M3 支援文字、圖像和影片輸入,並能操作桌面電腦,展現了其在複雜代理工作流程中的應用潛力,例如自主重現研究論文實驗或優化 NVIDIA Hopper GPU 核心。
📊 競品分析▸ Show
模型名稱多模態能力上下文窗口開源狀態SWE-Bench Pro (編碼)BrowseComp (網頁瀏覽)Terminal-Bench 2.1 (終端執行)API 定價 (每百萬 token)
MiniMax M3文字、圖像、影片、桌面操作1M tokens (保證 512K)聲稱開源 (權重待發布)59.0%83.5%66.0%輸入 $0.30 / 輸出 $1.20 (促銷價)
Anthropic Claude Opus 4.8通用多模態長上下文 (具體數值未提供)閉源69.2% (Opus 4.8)79.3% (Opus 4.7)74.6% (Opus 4.8)通常較高
OpenAI GPT-5.5通用多模態 (GPT-5.4 支援視覺+音訊、電腦操作)未明確提供閉源58.6%未明確提供未明確提供通常較高
Google Gemini 3.1 Pro文字、圖像、影片、音訊1M tokens (Gemini 3.5 Flash)閉源54.2%未明確提供未明確提供通常較高

🛠️ 技術深入

  • MiniMax 稀疏注意力 (MSA) 架構:
    • 取代標準 Transformer 模型中計算複雜度呈二次方增長的注意力機制,以解決長上下文處理的成本問題。
    • 採用兩階段機制:輕量級索引分支首先掃描輸入 token 並選擇相關的鍵值 (KV) 緩存區塊,然後僅對這些選定的區塊執行昂貴的注意力計算。
    • 在百萬級 token 上下文長度下,每 token 計算量降至前一代 M2 的 1/20。
    • 據 MiniMax 報告,輸入處理速度提升約 9.7 倍,響應生成速度提升約 15.6 倍(在完整上下文長度下)。
    • 與 DeepSeek 的多頭潛在注意力不同,MSA 在未壓縮的鍵值數據上操作,公司聲稱這避免了長上下文中的精度損失。
  • 原生多模態訓練:
    • M3 是從「零步驟」開始進行混合模態訓練的原生多模態模型,而非將預訓練的文本網絡與單獨的視覺模型融合。
    • MiniMax 重組了整個數據管線,將預訓練數據擴展到數百 TB,實現了文本和視覺語義空間的深度對齊。
  • 上下文窗口:
    • 支援高達 100 萬 token 的上下文窗口,並保證至少 512K token,為長程代理任務、長程編碼和長影片理解提供基礎設施。

🔮 前景展望AI analysis grounded in cited sources

開源多模態模型將加速 AI 創新與普及。
MiniMax M3 作為首個結合前沿編碼、百萬級上下文和原生多模態能力的開源模型,降低了尖端 AI 技術的門檻,鼓勵更廣泛的開發者社區參與創新。
AI 代理的自主執行能力將大幅提升。
M3 在自主重現研究論文和優化 GPU 核心等任務中展現的長程自主執行能力,預示著 AI 代理在複雜、多步驟任務中的應用將更加廣泛和高效。
稀疏注意力機制將成為長上下文 AI 模型的主流技術。
MiniMax 稀疏注意力 (MSA) 顯著降低了長上下文處理的計算成本並提升了速度,使其成為實現經濟高效的百萬級 token 上下文窗口的關鍵技術,其他領先模型也採用了類似方法。

時間線

2021-12
MiniMax 成立
2022-10
推出 Glow 應用程式 (後更名為 Talkie)
2024-03
阿里巴巴集團領投 6 億美元融資,公司估值達 25 億美元
2025-01
推出 MiniMax-01 LLM 產品線,包括 MiniMax-Text-01 和 MiniMax-VL-01
2025-10
推出 MiniMax M2 模型
2026-01
MiniMax 在香港證券交易所上市
2026-03
推出 MiniMax M2.7 模型
2026-06
推出 MiniMax M3 模型
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位