🏠較早收集於 14m

小米 MiMo UltraSpeed:突破每秒 1000 tokens 推理速度

小米 MiMo UltraSpeed:突破每秒 1000 tokens 推理速度
PostLinkedIn
🏠閱讀原文: IT之家

💡萬億參數模型在通用 GPU 上首次突破每秒 1000 tokens 推理速度,即時 AI 應用的重大飛躍。

⚡ 30-Second TL;DR

有什麼變化

UltraSpeed 模式實現萬億參數模型每秒超過 1000 tokens 的生成速度。

為什麼重要

此項突破顯著降低了即時 AI 應用的延遲門檻,有望推動過去受限於推理速度的複雜代理工作流發展。

下一步行動

透過官方平台申請 MiMo-V2.5-Pro UltraSpeed API 存取權限,以測試您的高延遲代理工作流。

誰應關注:Developers & AI Engineers

關鍵要點

  • UltraSpeed 模式實現萬億參數模型每秒超過 1000 tokens 的生成速度。
  • 透過模型與系統的協同設計,優化通用 GPU 上的推理效能。
  • API 存取權限目前僅開放給通過審核的企業與專業開發者,期限至 2026 年 6 月 23 日。

🧠 深度解析

Web-grounded analysis with 9 cited sources.

🔑 增強重點摘要

  • MiMo-V2.5-Pro 採用了混合專家(MoE)架構,總參數達1.02萬億,但在推理過程中僅激活420億參數,大幅降低了計算成本同時維持龐大的知識儲備。
  • 該模型支援高達100萬token的超長上下文窗口,使其能夠處理大量文件或程式碼庫,適用於複雜且需長時間自主運行的任務。
  • MiMo-V2.5-Pro 整合了混合注意力機制,以6:1的比例交替使用滑動窗口注意力(SWA)和全局注意力(GA),有效優化了長文本理解能力,同時降低了計算複雜度和記憶體佔用。
  • 相較於西方競爭對手如Claude Opus 4.6或Gemini 3.1 Pro,MiMo-V2.5-Pro在處理複雜任務時可減少40-60%的token消耗,且API成本約為其六分之一。
  • MiMo-V2.5-Pro在ClawEval、GDPVal-AA和SWE-bench Pro等多項基準測試中表現出色,證明其在智能體能力、複雜軟體工程和真實世界智能體任務方面的領先地位。
📊 競品分析▸ Show

小米MiMo UltraSpeed 與主要競爭者比較

特性/模型小米 MiMo-V2.5-Pro UltraSpeedCursor AI (基於阿里RTP-LLM)Claude Opus 4.6 / Gemini 3.1 Pro
推理速度通用GPU上每秒超過1000 tokens實現每秒1000 tokens未明確通用GPU上萬億參數模型速度
模型架構MoE (總參數1.02T,激活42B)採用投機採樣等技術閉源,具體架構未公開
上下文窗口最長100萬token未公開長上下文能力,具體長度未公開
成本效率處理複雜任務token消耗少40-60%,API成本約為競品1/6未公開相對較高的token消耗和API成本
主要優化點模型與系統協同設計、混合注意力機制投機採樣、最大化算力利用率未公開

🛠️ 技術深入

  • 模型架構:MiMo-V2.5-Pro採用混合專家(Mixture-of-Experts, MoE)架構,總參數達1.02萬億,但在推理時僅激活420億參數,顯著提升了效率。
  • 上下文處理:支援高達100萬token的超長上下文窗口,能夠一次性處理大量資訊,適用於複雜的長程任務。
  • 注意力機制:採用創新的混合注意力架構,以6:1的比例交替使用滑動窗口注意力(SWA)和全局注意力(GA),在保持長文本理解能力的同時,大幅降低了計算成本和顯存佔用。
  • 推理優化:UltraSpeed模式透過模型與系統的協同設計,優化通用GPU上的推理效能。具體技術可能包括類似投機採樣(Speculative Sampling)等加速手段,該技術能將逐個token的解碼過程轉化為對多個token的並行計算,且能保證精度不丟失。
  • KV Cache優化:在處理長文本時,MiMo-V2.5-Pro的KV緩存儲存空間減少近7倍,有助於支援超長上下文。
  • 多模態能力:MiMo-V2.5系列還包含全模態版本,具備文字、圖像、音影片理解能力。MiMo-V2.5-TTS系列基於超過1億小時的語音數據預訓練,採用自研的多碼本語音建模架構,並與ASR模型共享底層Transformer模組,實現30-40%的參數減少和2-3倍的推理速度提升。

🔮 前景展望AI analysis grounded in cited sources

小米將加速其「人車家全生態」戰略中的AI整合。
MiMo模型作為小米「人車家全生態」戰略的核心AI底座,其推理速度的突破將使其AI服務能更流暢、即時地融入手機、智能家居和輔助駕駛系統。
大模型推理成本將大幅降低,推動AI應用普及。
MiMo UltraSpeed模式在通用GPU上實現高效率推理,結合其低API成本策略,將降低企業部署和使用大型語言模型的門檻,加速AI技術的商業化落地。
稀疏激活(MoE)和混合注意力機制將成為大模型優化的主流方向。
MiMo-V2.5-Pro採用MoE架構和混合注意力機制,在保持萬億參數知識儲備的同時顯著提升推理效率和降低成本,預示著這些技術將被更廣泛地應用於未來大模型的設計。

時間線

2025-04-30
小米發布首個開源AI推理大模型MiMo-7B系列。
2025-12-17
小米發布並開源MoE大模型MiMo-V2-Flash,總參數3090億,激活參數150億。
2026-03-18
小米發布MiMo-V2系列,包括MiMo-V2-Pro、MiMo-V2-Omni和MiMo-V2-TTS。
2026-04-22
小米發布MiMo-V2.5與MiMo-V2.5-Pro兩款模型。
2026-04-28
MiMo-V2.5系列正式完全開源,並啟動「MiMo Orbit百萬億Token創造者激勵計劃」。
2026-06-08
小米與TileRT聯合發布MiMo-V2.5-Pro的UltraSpeed模式,實現每秒超過1000 tokens的生成速度。

📎 來源 (9)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. wikipedia.org
  2. segmentfault.com
  3. cnblogs.com
  4. cnblogs.com
  5. openrouter.ai
  6. infoq.cn
  7. csdn.net
  8. smzdm.com
  9. introl.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家