來源近期收集於 15h

Xiaomi 直播 Agent RL 訓練過程

閱讀原文: Pandaily
#agent-training#training-costs

Xiaomi 公開大規模 Agent 強化學習背後的步數、獎勵、Token 與成本。

30 秒速覽

有什麼變化

直播涵蓋 MiMo-V2.6 Pro 與 MiMo-V2.6 Flash。

為什麼重要

公開訓練遙測資料可能提升可重現性,並幫助實作者理解 Agent 後訓練的經濟成本。這也可能促使其他研究機構披露更多運營指標。

下一步行動

監看 MiMo RL 儀表板,並記錄每 Token 獎勵與成本趨勢,以便與你自己的 Agent 後訓練結果比較。

誰應關注:Researchers & Academics

關鍵要點

  • 直播涵蓋 MiMo-V2.6 Pro 與 MiMo-V2.6 Flash。
  • 觀眾可查看訓練步數、Token 使用量、獎勵與成本。
  • 儀表板提供少見的大規模 Agent RL 訓練透明度。
關鍵數字100 萬113 萬2 萬20 億

深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

增強重點摘要

  • 小米 MiMo 團隊在公開儀表板(mimo.xiaomi.com/rl/)全面直播 MiMo-V2.6 訓練進度,啟動後約 36 至 48 小時內累計運算成本即突破 100 萬至 113 萬美元,其中 Pro 版本的尖峰消耗達到每小時約 2 萬美元(相當於每秒 5 美元)。
  • 訓練架構採用大規模非同步 Rollout 機制,單一步驟在 1,568 個提示詞下處理約 20 億個 Token,且每個提示詞平行生成 16 組非同步 Rollout。
  • 訓練管線徹底解耦 Rollout 生成、環境執行、獎勵評分與參數更新的同步障礙,並在單一作業中融合程式碼、通用推理、視覺、對話與網路安全等多任務 Agent 環境。
  • 儀表板即時評測顯示,MiMo-V2.6-Pro 在 DeepSWE v1.1 基準測試中取得 62% 至近 66% 的成績(mini-swe-agent, avg@3),相較前代 MiMo-V2.5 的約 19% 呈現大幅躍升。
  • 前 DeepSeek 成員、現任小米 MiMo 負責人羅福莉表示該直播旨在探討 Agent RL 的擴展極限,並承諾未來數週內將陸續開源完整技術細節、訓練配方與基礎設施工具。

競品分析

Xiaomi MiMo-V2.6 (Pro / Flash)
開源 / 透明度
即時公開儀表板(逐步釋出配方與工具)
RL 後訓練規模與成本揭露
即時揭露成本,36-48 小時耗資逾 100 萬美元(尖峰約 $20,000/小時)
核心訓練架構與評估環境
完全解耦非同步 Rollout(單步 20 億 Token / 16 Rollouts)、混合多任務 Agent 環境與重度 Grader 評分
DeepSeek-R1
開源 / 透明度
開源權重與技術報告
RL 後訓練規模與成本揭露
事後公開整體訓練預算與總成本,無即時儀表板
核心訓練架構與評估環境
基於大規模強化學習(純 RL 探索與多階段對齊),專注於數學與程式碼推理
MiniMax-M1
開源 / 透明度
部分開放 API / 商業報告
RL 後訓練規模與成本揭露
僅事後公開訓練成本與階段性指標,無公開即時日誌
核心訓練架構與評估環境
著重於混合架構與後訓練推理強化,依賴內部閉源集群管線
西方前沿實驗室 (如 OpenAI / Anthropic)
開源 / 透明度
閉源 / 不透明
RL 後訓練規模與成本揭露
完全保密,僅公布推論定價與技術報告精選數據
核心訓練架構與評估環境
閉門分散式強化學習系統,訓練失敗、重啟日誌與即時步進成本均不對外公開

技術深入

  • 非同步 Rollout 規模:單一訓練步驟即涵蓋約 20 億個 Token 與 1,568 個提示詞,每個提示詞配置 16 組非同步 Rollout,以極高平行度探索策略空間。
  • 完全解耦管線設計:解除 Rollout 生成、環境互動執行、獎勵計算及參數梯度更新之間的剛性同步屏障,大幅提升龐大叢集利用率。
  • 多任務 Agent 環境整合:在單一訓練任務中融合多維度環境,包含程式碼生成、通用多步推理、視覺理解、長文本對話以及網路安全攻防模擬。
  • 高負載 Grader 計算與信用分配:採用高運算負載的評判器(Grader compute),結合確定性測試案例(Deterministic test cases)與評分量表(Rubrics)進行 Agent 組內信用分配(In-group credit assignment)。

前景展望基於引用來源的 AI 分析

前沿模型強化學習的黑箱研發常態將受到公開透明化挑戰
小米即時串流失敗日誌、硬體崩潰重啟與單步開銷的作法,將迫使產業重新審視後訓練階段的數據可信度與實際算力門檻。
軟體工程 Agent 的基準能力將加速跨過實用化門檻
MiMo-V2.6-Pro 在 DeepSWE v1.1 達到超過 62% 的中期成績,顯示非同步多工 RL 擴展能大幅壓縮工程型 Agent 的演進週期。

時間線

2026-03
小米推出 MiMo-V2.5 基礎模型並啟動 Agent RL 規模化實驗
2026-09
小米發表具身智慧模型 Robotics-U0(38B/4B 自回歸世界模型)
2026-09
小米 MiMo 團隊啟動 MiMo-V2.6 Pro 與 Flash 之 Agent RL 即時公開直播

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。