💼VentureBeat•較早收集於 2m
MiniMax 預告 M3 模型,長文本處理速度提升 15.6 倍

💡了解 MiniMax 如何透過全新的稀疏注意力機制,實現長文本 AI 代理 15.6 倍的速度提升。
⚡ 30-Second TL;DR
有什麼變化
MiniMax M3 將採用自定義的次二次方(sub-quadratic)稀疏注意力框架。
為什麼重要
解碼速度的突破顯著降低了在企業生產環境中部署複雜長文本 AI 代理的門檻。
下一步行動
閱讀 MiniMax M2 技術報告,了解其 MoE 路由策略,以優化您自己的模型微調工作流程。
誰應關注:Developers & AI Engineers
關鍵要點
- •MiniMax M3 將採用自定義的次二次方(sub-quadratic)稀疏注意力框架。
- •M2 系列使用混合專家模型(MoE)架構,總參數達 2299 億。
- •M2 透過在 256 個專家模型中僅激活每個 token 98 億參數來實現高效運作。
- •全新的 M3 架構旨在使超長文本 AI 代理的部署在經濟上更具可行性。
🧠 深度解析
Web-grounded analysis with 24 cited sources.
🔑 增強重點摘要
- •MiniMax是一家中國AI新創公司,由前商湯科技研究員於2021年末至2022年初創立,並於2026年1月在香港證券交易所上市,透過7輪融資籌集了15億美元資金。
- •該公司開發多模態AI模型,涵蓋文本、圖像、影片、音訊和音樂生成,並推出多款消費者應用程式,例如AI角色應用程式Talkie和星野,以及影片生成服務Hailuo AI。
- •MiniMax的M2系列模型(如M2.5、M2.7)採用混合專家模型(MoE)架構,總參數達2300億,但在每次推論時僅激活約100億參數,以實現高效運作。
- •MiniMax曾面臨多項法律挑戰,包括2025年9月迪士尼、環球影業和華納兄弟探索公司就Hailuo AI訓練數據提起的版權訴訟,以及2026年2月Anthropic指控其使用欺詐賬戶來改進大型語言模型。
- •MiniMax-01系列模型於2025年1月推出,引入了「閃電注意力」(Lightning Attention)機制,實現了高達400萬token的上下文長度,超越了當時許多主流模型。
📊 競品分析▸ Show
| 特性/模型 | MiniMax M2.5/M2.7 | MiniMax M1-80k | Claude Opus 4.6 | GPT-5.4 | DeepSeek-R1 | Google Gemini 2.5 Pro |
|---|---|---|---|---|---|---|
| 架構 | MoE (230B總參數, 10B活躍) | MoE (456B總參數, 45.9B活躍) | 專有MoE | 專有MoE | MoE (671B總參數) | 多模態MoE |
| 上下文窗口 | 204K token | 1M token | 長上下文 (>200K) | - | - | 長上下文 |
| SWE-Bench Verified | M2.5: 80.2%, M2.7: 86.2% | 56.0% | 86.2% (與M2.7接近) | 86.4% (與M2.7接近) | 表現優於M1-80k | - |
| PinchBench | M2.7: 86.2% (排名第5) | - | 86.2% (與M2.7接近) | 86.4% (與M2.7接近) | - | - |
| 推理速度 | M2.5 Standard: 50 token/s, M2.5 Lightning: 100 token/s | 最快推理LLM (M1) | - | - | - | - |
| 成本 (每百萬token) | M2.5 Standard: 輸入$0.15 / 輸出$1.20 | - | 輸出$60-75 (估計) | - | 輸入$0.28 / 輸出$0.42 | Gemini 2.5 Flash: 輸入$0.30 / 輸出$2.50 |
| 主要優勢 | 高效、成本效益高、代理工作流優化、編碼能力強 | 百萬token上下文、閃電注意力、FLOPs節省 | 企業級安全、多模態推理 | - | 強大的推理能力 | 多模態、廣泛應用整合 |
🛠️ 技術深入
- M3模型架構預告:將採用自定義的次二次方(sub-quadratic)稀疏注意力框架,旨在將長文本解碼速度提升15.6倍,預填充速度提升9.7倍(在100萬token時)。
- M2系列模型架構:基於混合專家模型(MoE),總參數為2300億,但在推論時僅激活約100億參數。M2.7模型具體配置為256個本地專家,每個token激活8個專家,並採用多頭因果自注意力機制,輔以旋轉位置嵌入(RoPE)和查詢-鍵均方根歸一化(QK RMSNorm)以確保大規模訓練的穩定性。
- MiniMax-01系列架構:採用創新的「閃電注意力」(Lightning Attention)機制,這是一種線性複雜度的注意力機制。其混合注意力結構在每8層區塊中包含7個閃電注意力層和1個傳統SoftMax注意力層。該模型總參數為4560億,每次推論激活459億參數,並結合MoE組件進行top-2路由。
- 稀疏注意力機制:傳統Transformer模型的注意力機制複雜度為O(n²),而稀疏注意力旨在將其降低到O(N log N)或O(N)。其核心思想是選擇性地關注相關token,而非所有token對。實現方式包括內容依賴路由、局部+分層注意力以及稀疏檢索。
- 訓練方法:M2.5/M2.7模型使用MiniMax專有的「Forge」強化學習框架進行訓練,該框架在超過20萬個真實世界環境中進行代理訓練,包括代碼庫、網絡瀏覽器和辦公應用程式。MiniMax-M1則採用了結合CISPO的強化學習方法。
🔮 前景展望AI analysis grounded in cited sources
MiniMax M3的長文本處理能力將加速AI代理的普及。
顯著提升的解碼速度和經濟可行性將使AI代理能夠處理更複雜、更長的任務,從而擴大其應用範圍。
MiniMax在稀疏注意力機制上的創新將推動業界對更高效LLM架構的探索。
M3模型展示的性能提升將激勵其他AI公司投資和開發類似的次二次方注意力解決方案,以克服傳統Transformer模型的二次方複雜度限制。
MiniMax的市場競爭力將因其成本效益和長文本處理優勢而進一步增強。
在提供與頂級模型相媲美的性能的同時,顯著降低長文本處理的成本,將吸引更多企業和開發者採用其API服務。
⏳ 時間線
2021-12
MiniMax成立,由前商湯科技研究員創立。
2022年初
獲得高瓴資本首輪投資。
2024-03
阿里巴巴集團領投6億美元融資,估值達25億美元。
2025-01
推出MiniMax-01系列模型,具備400萬token上下文長度。
2025-09
迪士尼等公司對MiniMax提起版權訴訟。
2026-01
在香港證券交易所首次公開募股(IPO)。
📎 來源 (24)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat ↗
