🏠IT之家•較早收集於 14m
小米 MiMo UltraSpeed:突破每秒 1000 tokens 推理速度

💡萬億參數模型在通用 GPU 上首次突破每秒 1000 tokens 推理速度,即時 AI 應用的重大飛躍。
⚡ 30-Second TL;DR
有什麼變化
UltraSpeed 模式實現萬億參數模型每秒超過 1000 tokens 的生成速度。
為什麼重要
此項突破顯著降低了即時 AI 應用的延遲門檻,有望推動過去受限於推理速度的複雜代理工作流發展。
下一步行動
透過官方平台申請 MiMo-V2.5-Pro UltraSpeed API 存取權限,以測試您的高延遲代理工作流。
誰應關注:Developers & AI Engineers
關鍵要點
- •UltraSpeed 模式實現萬億參數模型每秒超過 1000 tokens 的生成速度。
- •透過模型與系統的協同設計,優化通用 GPU 上的推理效能。
- •API 存取權限目前僅開放給通過審核的企業與專業開發者,期限至 2026 年 6 月 23 日。
🧠 深度解析
Web-grounded analysis with 9 cited sources.
🔑 增強重點摘要
- •MiMo-V2.5-Pro 採用了混合專家(MoE)架構,總參數達1.02萬億,但在推理過程中僅激活420億參數,大幅降低了計算成本同時維持龐大的知識儲備。
- •該模型支援高達100萬token的超長上下文窗口,使其能夠處理大量文件或程式碼庫,適用於複雜且需長時間自主運行的任務。
- •MiMo-V2.5-Pro 整合了混合注意力機制,以6:1的比例交替使用滑動窗口注意力(SWA)和全局注意力(GA),有效優化了長文本理解能力,同時降低了計算複雜度和記憶體佔用。
- •相較於西方競爭對手如Claude Opus 4.6或Gemini 3.1 Pro,MiMo-V2.5-Pro在處理複雜任務時可減少40-60%的token消耗,且API成本約為其六分之一。
- •MiMo-V2.5-Pro在ClawEval、GDPVal-AA和SWE-bench Pro等多項基準測試中表現出色,證明其在智能體能力、複雜軟體工程和真實世界智能體任務方面的領先地位。
📊 競品分析▸ Show
小米MiMo UltraSpeed 與主要競爭者比較
| 特性/模型 | 小米 MiMo-V2.5-Pro UltraSpeed | Cursor AI (基於阿里RTP-LLM) | Claude Opus 4.6 / Gemini 3.1 Pro |
|---|---|---|---|
| 推理速度 | 通用GPU上每秒超過1000 tokens | 實現每秒1000 tokens | 未明確通用GPU上萬億參數模型速度 |
| 模型架構 | MoE (總參數1.02T,激活42B) | 採用投機採樣等技術 | 閉源,具體架構未公開 |
| 上下文窗口 | 最長100萬token | 未公開 | 長上下文能力,具體長度未公開 |
| 成本效率 | 處理複雜任務token消耗少40-60%,API成本約為競品1/6 | 未公開 | 相對較高的token消耗和API成本 |
| 主要優化點 | 模型與系統協同設計、混合注意力機制 | 投機採樣、最大化算力利用率 | 未公開 |
🛠️ 技術深入
- 模型架構:MiMo-V2.5-Pro採用混合專家(Mixture-of-Experts, MoE)架構,總參數達1.02萬億,但在推理時僅激活420億參數,顯著提升了效率。
- 上下文處理:支援高達100萬token的超長上下文窗口,能夠一次性處理大量資訊,適用於複雜的長程任務。
- 注意力機制:採用創新的混合注意力架構,以6:1的比例交替使用滑動窗口注意力(SWA)和全局注意力(GA),在保持長文本理解能力的同時,大幅降低了計算成本和顯存佔用。
- 推理優化:UltraSpeed模式透過模型與系統的協同設計,優化通用GPU上的推理效能。具體技術可能包括類似投機採樣(Speculative Sampling)等加速手段,該技術能將逐個token的解碼過程轉化為對多個token的並行計算,且能保證精度不丟失。
- KV Cache優化:在處理長文本時,MiMo-V2.5-Pro的KV緩存儲存空間減少近7倍,有助於支援超長上下文。
- 多模態能力:MiMo-V2.5系列還包含全模態版本,具備文字、圖像、音影片理解能力。MiMo-V2.5-TTS系列基於超過1億小時的語音數據預訓練,採用自研的多碼本語音建模架構,並與ASR模型共享底層Transformer模組,實現30-40%的參數減少和2-3倍的推理速度提升。
🔮 前景展望AI analysis grounded in cited sources
小米將加速其「人車家全生態」戰略中的AI整合。
MiMo模型作為小米「人車家全生態」戰略的核心AI底座,其推理速度的突破將使其AI服務能更流暢、即時地融入手機、智能家居和輔助駕駛系統。
大模型推理成本將大幅降低,推動AI應用普及。
MiMo UltraSpeed模式在通用GPU上實現高效率推理,結合其低API成本策略,將降低企業部署和使用大型語言模型的門檻,加速AI技術的商業化落地。
稀疏激活(MoE)和混合注意力機制將成為大模型優化的主流方向。
MiMo-V2.5-Pro採用MoE架構和混合注意力機制,在保持萬億參數知識儲備的同時顯著提升推理效率和降低成本,預示著這些技術將被更廣泛地應用於未來大模型的設計。
⏳ 時間線
2025-04-30
小米發布首個開源AI推理大模型MiMo-7B系列。
2025-12-17
小米發布並開源MoE大模型MiMo-V2-Flash,總參數3090億,激活參數150億。
2026-03-18
小米發布MiMo-V2系列,包括MiMo-V2-Pro、MiMo-V2-Omni和MiMo-V2-TTS。
2026-04-22
小米發布MiMo-V2.5與MiMo-V2.5-Pro兩款模型。
2026-04-28
MiMo-V2.5系列正式完全開源,並啟動「MiMo Orbit百萬億Token創造者激勵計劃」。
2026-06-08
小米與TileRT聯合發布MiMo-V2.5-Pro的UltraSpeed模式,實現每秒超過1000 tokens的生成速度。
📎 來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家 ↗