💼較早收集於 2m

MiniMax 預告 M3 模型,長文本處理速度提升 15.6 倍

MiniMax 預告 M3 模型,長文本處理速度提升 15.6 倍
PostLinkedIn
💼閱讀原文: VentureBeat

💡了解 MiniMax 如何透過全新的稀疏注意力機制,實現長文本 AI 代理 15.6 倍的速度提升。

⚡ 30-Second TL;DR

有什麼變化

MiniMax M3 將採用自定義的次二次方(sub-quadratic)稀疏注意力框架。

為什麼重要

解碼速度的突破顯著降低了在企業生產環境中部署複雜長文本 AI 代理的門檻。

下一步行動

閱讀 MiniMax M2 技術報告,了解其 MoE 路由策略,以優化您自己的模型微調工作流程。

誰應關注:Developers & AI Engineers

關鍵要點

  • MiniMax M3 將採用自定義的次二次方(sub-quadratic)稀疏注意力框架。
  • M2 系列使用混合專家模型(MoE)架構,總參數達 2299 億。
  • M2 透過在 256 個專家模型中僅激活每個 token 98 億參數來實現高效運作。
  • 全新的 M3 架構旨在使超長文本 AI 代理的部署在經濟上更具可行性。

🧠 深度解析

Web-grounded analysis with 24 cited sources.

🔑 增強重點摘要

  • MiniMax是一家中國AI新創公司,由前商湯科技研究員於2021年末至2022年初創立,並於2026年1月在香港證券交易所上市,透過7輪融資籌集了15億美元資金。
  • 該公司開發多模態AI模型,涵蓋文本、圖像、影片、音訊和音樂生成,並推出多款消費者應用程式,例如AI角色應用程式Talkie和星野,以及影片生成服務Hailuo AI。
  • MiniMax的M2系列模型(如M2.5、M2.7)採用混合專家模型(MoE)架構,總參數達2300億,但在每次推論時僅激活約100億參數,以實現高效運作。
  • MiniMax曾面臨多項法律挑戰,包括2025年9月迪士尼、環球影業和華納兄弟探索公司就Hailuo AI訓練數據提起的版權訴訟,以及2026年2月Anthropic指控其使用欺詐賬戶來改進大型語言模型。
  • MiniMax-01系列模型於2025年1月推出,引入了「閃電注意力」(Lightning Attention)機制,實現了高達400萬token的上下文長度,超越了當時許多主流模型。
📊 競品分析▸ Show
特性/模型MiniMax M2.5/M2.7MiniMax M1-80kClaude Opus 4.6GPT-5.4DeepSeek-R1Google Gemini 2.5 Pro
架構MoE (230B總參數, 10B活躍)MoE (456B總參數, 45.9B活躍)專有MoE專有MoEMoE (671B總參數)多模態MoE
上下文窗口204K token1M token長上下文 (>200K)--長上下文
SWE-Bench VerifiedM2.5: 80.2%, M2.7: 86.2%56.0%86.2% (與M2.7接近)86.4% (與M2.7接近)表現優於M1-80k-
PinchBenchM2.7: 86.2% (排名第5)-86.2% (與M2.7接近)86.4% (與M2.7接近)--
推理速度M2.5 Standard: 50 token/s, M2.5 Lightning: 100 token/s最快推理LLM (M1)----
成本 (每百萬token)M2.5 Standard: 輸入$0.15 / 輸出$1.20-輸出$60-75 (估計)-輸入$0.28 / 輸出$0.42Gemini 2.5 Flash: 輸入$0.30 / 輸出$2.50
主要優勢高效、成本效益高、代理工作流優化、編碼能力強百萬token上下文、閃電注意力、FLOPs節省企業級安全、多模態推理-強大的推理能力多模態、廣泛應用整合

🛠️ 技術深入

  • M3模型架構預告:將採用自定義的次二次方(sub-quadratic)稀疏注意力框架,旨在將長文本解碼速度提升15.6倍,預填充速度提升9.7倍(在100萬token時)。
  • M2系列模型架構:基於混合專家模型(MoE),總參數為2300億,但在推論時僅激活約100億參數。M2.7模型具體配置為256個本地專家,每個token激活8個專家,並採用多頭因果自注意力機制,輔以旋轉位置嵌入(RoPE)和查詢-鍵均方根歸一化(QK RMSNorm)以確保大規模訓練的穩定性。
  • MiniMax-01系列架構:採用創新的「閃電注意力」(Lightning Attention)機制,這是一種線性複雜度的注意力機制。其混合注意力結構在每8層區塊中包含7個閃電注意力層和1個傳統SoftMax注意力層。該模型總參數為4560億,每次推論激活459億參數,並結合MoE組件進行top-2路由。
  • 稀疏注意力機制:傳統Transformer模型的注意力機制複雜度為O(n²),而稀疏注意力旨在將其降低到O(N log N)或O(N)。其核心思想是選擇性地關注相關token,而非所有token對。實現方式包括內容依賴路由、局部+分層注意力以及稀疏檢索。
  • 訓練方法:M2.5/M2.7模型使用MiniMax專有的「Forge」強化學習框架進行訓練,該框架在超過20萬個真實世界環境中進行代理訓練,包括代碼庫、網絡瀏覽器和辦公應用程式。MiniMax-M1則採用了結合CISPO的強化學習方法。

🔮 前景展望AI analysis grounded in cited sources

MiniMax M3的長文本處理能力將加速AI代理的普及。
顯著提升的解碼速度和經濟可行性將使AI代理能夠處理更複雜、更長的任務,從而擴大其應用範圍。
MiniMax在稀疏注意力機制上的創新將推動業界對更高效LLM架構的探索。
M3模型展示的性能提升將激勵其他AI公司投資和開發類似的次二次方注意力解決方案,以克服傳統Transformer模型的二次方複雜度限制。
MiniMax的市場競爭力將因其成本效益和長文本處理優勢而進一步增強。
在提供與頂級模型相媲美的性能的同時,顯著降低長文本處理的成本,將吸引更多企業和開發者採用其API服務。

時間線

2021-12
MiniMax成立,由前商湯科技研究員創立。
2022年初
獲得高瓴資本首輪投資。
2024-03
阿里巴巴集團領投6億美元融資,估值達25億美元。
2025-01
推出MiniMax-01系列模型,具備400萬token上下文長度。
2025-09
迪士尼等公司對MiniMax提起版權訴訟。
2026-01
在香港證券交易所首次公開募股(IPO)。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat