來源較早收集於 3h

MiniMax M3 手測:多模態推理能力實測

MiniMax M3 手測:多模態推理能力實測
PostLinkedIn
⚛️閱讀原文: 量子位
#multimodal#vision-model#benchmarkminimax-m3minimaxnvidiam3

💡中國多模態模型能處理複雜的 Nvidia 簡報嗎?看看 MiniMax M3 在實際視覺測試中的表現。

⚡ 30 秒速覽

有什麼變化

針對複雜的 Nvidia 簡報進行 MiniMax M3 實測

為什麼重要

顯示中國多模態模型在競爭全球頂尖基準測試方面的快速進步。這表明在視覺理解任務上的差距正在縮小。

下一步行動

評估 MiniMax M3 的 API 以應用於您的特定視覺提取工作流程,並與 GPT-4o 進行比較。

誰應關注:Developers & AI Engineers

關鍵要點

  • 針對複雜的 Nvidia 簡報進行 MiniMax M3 實測
  • 評估視覺辨識與推理效能
  • 展示處理高密度視覺資料的能力

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 15 個來源。

🔑 增強重點摘要

  • MiniMax M3 聲稱是首個結合了前沿編碼、百萬級上下文窗口和原生多模態能力的開源模型,儘管其權重尚未完全發布以供獨立驗證。
  • M3 採用專有的 MiniMax 稀疏注意力(MSA)架構,該架構透過兩階段機制顯著降低了長上下文處理的計算成本,使其每 token 計算量僅為前一代 M2 的 1/20。
  • 該模型在編碼和代理任務方面表現出色,在 SWE-Bench Pro 等基準測試中超越了 GPT-5.5 和 Gemini 3.1 Pro,並在 BrowseComp 網頁瀏覽基準測試中超越了 Claude Opus 4.7。
  • M3 支援文字、圖像和影片輸入,並能操作桌面電腦,展現了其在複雜代理工作流程中的應用潛力,例如自主重現研究論文實驗或優化 NVIDIA Hopper GPU 核心。
📊 競品分析▸ Show
模型名稱多模態能力上下文窗口開源狀態SWE-Bench Pro (編碼)BrowseComp (網頁瀏覽)Terminal-Bench 2.1 (終端執行)API 定價 (每百萬 token)
MiniMax M3文字、圖像、影片、桌面操作1M tokens (保證 512K)聲稱開源 (權重待發布)59.0%83.5%66.0%輸入 $0.30 / 輸出 $1.20 (促銷價)
Anthropic Claude Opus 4.8通用多模態長上下文 (具體數值未提供)閉源69.2% (Opus 4.8)79.3% (Opus 4.7)74.6% (Opus 4.8)通常較高
OpenAI GPT-5.5通用多模態 (GPT-5.4 支援視覺+音訊、電腦操作)未明確提供閉源58.6%未明確提供未明確提供通常較高
Google Gemini 3.1 Pro文字、圖像、影片、音訊1M tokens (Gemini 3.5 Flash)閉源54.2%未明確提供未明確提供通常較高

🛠️ 技術深入

  • MiniMax 稀疏注意力 (MSA) 架構:
    • 取代標準 Transformer 模型中計算複雜度呈二次方增長的注意力機制,以解決長上下文處理的成本問題。
    • 採用兩階段機制:輕量級索引分支首先掃描輸入 token 並選擇相關的鍵值 (KV) 緩存區塊,然後僅對這些選定的區塊執行昂貴的注意力計算。
    • 在百萬級 token 上下文長度下,每 token 計算量降至前一代 M2 的 1/20。
    • 據 MiniMax 報告,輸入處理速度提升約 9.7 倍,響應生成速度提升約 15.6 倍(在完整上下文長度下)。
    • 與 DeepSeek 的多頭潛在注意力不同,MSA 在未壓縮的鍵值數據上操作,公司聲稱這避免了長上下文中的精度損失。
  • 原生多模態訓練:
    • M3 是從「零步驟」開始進行混合模態訓練的原生多模態模型,而非將預訓練的文本網絡與單獨的視覺模型融合。
    • MiniMax 重組了整個數據管線,將預訓練數據擴展到數百 TB,實現了文本和視覺語義空間的深度對齊。
  • 上下文窗口:
    • 支援高達 100 萬 token 的上下文窗口,並保證至少 512K token,為長程代理任務、長程編碼和長影片理解提供基礎設施。

🔮 前景展望基於引用來源的 AI 分析

開源多模態模型將加速 AI 創新與普及。
MiniMax M3 作為首個結合前沿編碼、百萬級上下文和原生多模態能力的開源模型,降低了尖端 AI 技術的門檻,鼓勵更廣泛的開發者社區參與創新。
AI 代理的自主執行能力將大幅提升。
M3 在自主重現研究論文和優化 GPU 核心等任務中展現的長程自主執行能力,預示著 AI 代理在複雜、多步驟任務中的應用將更加廣泛和高效。
稀疏注意力機制將成為長上下文 AI 模型的主流技術。
MiniMax 稀疏注意力 (MSA) 顯著降低了長上下文處理的計算成本並提升了速度,使其成為實現經濟高效的百萬級 token 上下文窗口的關鍵技術,其他領先模型也採用了類似方法。

時間線

2021-12
MiniMax 成立
2022-10
推出 Glow 應用程式 (後更名為 Talkie)
2024-03
阿里巴巴集團領投 6 億美元融資,公司估值達 25 億美元
2025-01
推出 MiniMax-01 LLM 產品線,包括 MiniMax-Text-01 和 MiniMax-VL-01
2025-10
推出 MiniMax M2 模型
2026-01
MiniMax 在香港證券交易所上市
2026-03
推出 MiniMax M2.7 模型
2026-06
推出 MiniMax M3 模型
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。