來源Pandaily•近期收集於 15h
Xiaomi 直播 Agent RL 訓練過程

#agent-training#training-costsmimo-v2.6-pro/flash-rl-dashboardxiaomimimo-v2.6mimo
Xiaomi 公開大規模 Agent 強化學習背後的步數、獎勵、Token 與成本。
30 秒速覽
有什麼變化
直播涵蓋 MiMo-V2.6 Pro 與 MiMo-V2.6 Flash。
為什麼重要
公開訓練遙測資料可能提升可重現性,並幫助實作者理解 Agent 後訓練的經濟成本。這也可能促使其他研究機構披露更多運營指標。
下一步行動
監看 MiMo RL 儀表板,並記錄每 Token 獎勵與成本趨勢,以便與你自己的 Agent 後訓練結果比較。
誰應關注:Researchers & Academics
關鍵要點
- •直播涵蓋 MiMo-V2.6 Pro 與 MiMo-V2.6 Flash。
- •觀眾可查看訓練步數、Token 使用量、獎勵與成本。
- •儀表板提供少見的大規模 Agent RL 訓練透明度。
關鍵數字100 萬113 萬2 萬20 億
深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
增強重點摘要
- •小米 MiMo 團隊在公開儀表板(mimo.xiaomi.com/rl/)全面直播 MiMo-V2.6 訓練進度,啟動後約 36 至 48 小時內累計運算成本即突破 100 萬至 113 萬美元,其中 Pro 版本的尖峰消耗達到每小時約 2 萬美元(相當於每秒 5 美元)。
- •訓練架構採用大規模非同步 Rollout 機制,單一步驟在 1,568 個提示詞下處理約 20 億個 Token,且每個提示詞平行生成 16 組非同步 Rollout。
- •訓練管線徹底解耦 Rollout 生成、環境執行、獎勵評分與參數更新的同步障礙,並在單一作業中融合程式碼、通用推理、視覺、對話與網路安全等多任務 Agent 環境。
- •儀表板即時評測顯示,MiMo-V2.6-Pro 在 DeepSWE v1.1 基準測試中取得 62% 至近 66% 的成績(mini-swe-agent, avg@3),相較前代 MiMo-V2.5 的約 19% 呈現大幅躍升。
- •前 DeepSeek 成員、現任小米 MiMo 負責人羅福莉表示該直播旨在探討 Agent RL 的擴展極限,並承諾未來數週內將陸續開源完整技術細節、訓練配方與基礎設施工具。
競品分析
Xiaomi MiMo-V2.6 (Pro / Flash)
- 開源 / 透明度
- 即時公開儀表板(逐步釋出配方與工具)
- RL 後訓練規模與成本揭露
- 即時揭露成本,36-48 小時耗資逾 100 萬美元(尖峰約 $20,000/小時)
- 核心訓練架構與評估環境
- 完全解耦非同步 Rollout(單步 20 億 Token / 16 Rollouts)、混合多任務 Agent 環境與重度 Grader 評分
DeepSeek-R1
- 開源 / 透明度
- 開源權重與技術報告
- RL 後訓練規模與成本揭露
- 事後公開整體訓練預算與總成本,無即時儀表板
- 核心訓練架構與評估環境
- 基於大規模強化學習(純 RL 探索與多階段對齊),專注於數學與程式碼推理
MiniMax-M1
- 開源 / 透明度
- 部分開放 API / 商業報告
- RL 後訓練規模與成本揭露
- 僅事後公開訓練成本與階段性指標,無公開即時日誌
- 核心訓練架構與評估環境
- 著重於混合架構與後訓練推理強化,依賴內部閉源集群管線
西方前沿實驗室 (如 OpenAI / Anthropic)
- 開源 / 透明度
- 閉源 / 不透明
- RL 後訓練規模與成本揭露
- 完全保密,僅公布推論定價與技術報告精選數據
- 核心訓練架構與評估環境
- 閉門分散式強化學習系統,訓練失敗、重啟日誌與即時步進成本均不對外公開
| 模型 / 實驗專案 | 開源 / 透明度 | RL 後訓練規模與成本揭露 | 核心訓練架構與評估環境 |
|---|---|---|---|
| Xiaomi MiMo-V2.6 (Pro / Flash) | 即時公開儀表板(逐步釋出配方與工具) | 即時揭露成本,36-48 小時耗資逾 100 萬美元(尖峰約 $20,000/小時) | 完全解耦非同步 Rollout(單步 20 億 Token / 16 Rollouts)、混合多任務 Agent 環境與重度 Grader 評分 |
| DeepSeek-R1 | 開源權重與技術報告 | 事後公開整體訓練預算與總成本,無即時儀表板 | 基於大規模強化學習(純 RL 探索與多階段對齊),專注於數學與程式碼推理 |
| MiniMax-M1 | 部分開放 API / 商業報告 | 僅事後公開訓練成本與階段性指標,無公開即時日誌 | 著重於混合架構與後訓練推理強化,依賴內部閉源集群管線 |
| 西方前沿實驗室 (如 OpenAI / Anthropic) | 閉源 / 不透明 | 完全保密,僅公布推論定價與技術報告精選數據 | 閉門分散式強化學習系統,訓練失敗、重啟日誌與即時步進成本均不對外公開 |
技術深入
- 非同步 Rollout 規模:單一訓練步驟即涵蓋約 20 億個 Token 與 1,568 個提示詞,每個提示詞配置 16 組非同步 Rollout,以極高平行度探索策略空間。
- 完全解耦管線設計:解除 Rollout 生成、環境互動執行、獎勵計算及參數梯度更新之間的剛性同步屏障,大幅提升龐大叢集利用率。
- 多任務 Agent 環境整合:在單一訓練任務中融合多維度環境,包含程式碼生成、通用多步推理、視覺理解、長文本對話以及網路安全攻防模擬。
- 高負載 Grader 計算與信用分配:採用高運算負載的評判器(Grader compute),結合確定性測試案例(Deterministic test cases)與評分量表(Rubrics)進行 Agent 組內信用分配(In-group credit assignment)。
前景展望基於引用來源的 AI 分析
前沿模型強化學習的黑箱研發常態將受到公開透明化挑戰
小米即時串流失敗日誌、硬體崩潰重啟與單步開銷的作法,將迫使產業重新審視後訓練階段的數據可信度與實際算力門檻。
軟體工程 Agent 的基準能力將加速跨過實用化門檻
MiMo-V2.6-Pro 在 DeepSWE v1.1 達到超過 62% 的中期成績,顯示非同步多工 RL 擴展能大幅壓縮工程型 Agent 的演進週期。
時間線
2026-03
小米推出 MiMo-V2.5 基礎模型並啟動 Agent RL 規模化實驗
2026-09
小米發表具身智慧模型 Robotics-U0(38B/4B 自回歸世界模型)
2026-09
小米 MiMo 團隊啟動 MiMo-V2.6 Pro 與 Flash 之 Agent RL 即時公開直播
- 2026-03小米推出 MiMo-V2.5 基礎模型並啟動 Agent RL 規模化實驗
- 2026-09小米發表具身智慧模型 Robotics-U0(38B/4B 自回歸世界模型)
- 2026-09小米 MiMo 團隊啟動 MiMo-V2.6 Pro 與 Flash 之 Agent RL 即時公開直播
來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
1Xiaomi Mimo V2 6 Rl Training Livestream Dashboardpandaily.com2xiaomi.commimo.xiaomi.com3Xiaomi Mimo V2 6 Rl Livestreamai-tldr.dev4biggo.comfinance.biggo.com5Xiaomi Mimo V2 6 Breaks Cover a 1t Class Chinese Lab Trains in Publicforkast.news6Xiaomi Livestreams Mimo V2 6 Reinforcement Learning Runstechnode.com7Xiaomi Robotics U0 Open Source Embodied World Modelpandaily.com
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily ↗
每週電子報
每週一封,可隨時退訂。


