來源ArXiv AI•較早收集於 19h
開放 Nemotron 訓練配方達到 IMO 金牌門檻

#test-time-compute#open-modelsnemotron-imo-benchnemotronnemotron-imo-benchnvidia
開放模型僅靠自然語言推理便達到 IMO 金牌門檻。
30 秒速覽
有什麼變化
該系統使用監督式微調與強化學習。
為什麼重要
這項工作提供了一套相當可重現的開放模型數學推理改進方法。它可能加速測試時搜尋、自我驗證與證明改進等研究,而不依賴專有工具。
下一步行動
下載釋出的 Nemotron 檢查點,並將其證明驗證迴圈與你目前的推理流程進行基準比較。
誰應關注:Researchers & Academics
關鍵要點
- •該系統使用監督式微調與強化學習。
- •三個 Nemotron 3 Ultra 檢查點負責生成、驗證與改進證明。
- •流程不使用形式化證明器、外部工具或網際網路存取。
- •研究人員釋出檢查點、資料、程式碼、解答與包含 200 題的基準測試。
深度解析
背景與延伸:來自公開資料,非原文內容。引用 10 個來源。
增強重點摘要
- •該論文由 NVIDIA 研究人員 Ivan Moshkov、Stephen Ge 等人於 2026 年 9 月發表,論文編號為 arXiv:2609.10712。
- •系統在 2026 年 IMO 獲得 30 分(滿分 42 分),成功突破該屆 29 分的金牌門檻。
- •核心架構採用三檢查點配置:Nemotron 3 Ultra 基礎模型、專屬 SFT 專家模型與專屬 RL 專家模型。
- •推論機制採用兩階段測試時運算(TTC),結合迭代式生成/批判/改進搜尋,以及高算力候選篩選評分階段。
- •NVIDIA 於 Hugging Face 開放開源專案 nvidia/nemotron-labs-imo-2026,涵蓋 OpenMDW-1.1 授權模型、推論腳本與 Nemotron-IMO-Bench(200 題奧數基準)。
競品分析
Nemotron 3 Ultra (IMO Pipeline)
- 開發機構
- NVIDIA
- 格式與工具依賴
- 純自然語言(無形式化證明器/無工具)
- 權重開放性
- 完全開源(包含檢查點與訓練配方)
- IMO / 競賽表現水準
- IMO 2026 金牌(30/42 分)
AlphaProof / AlphaGeometry
- 開發機構
- Google DeepMind
- 格式與工具依賴
- 形式化語言(Lean)與符號工具輔助
- 權重開放性
- 閉源 / 專有系統
- IMO / 競賽表現水準
- IMO 2024 等級銀/金牌水準
Gemini Deep Think
- 開發機構
- Google DeepMind
- 格式與工具依賴
- 多模態自然語言與內部搜尋
- 權重開放性
- 閉源 / 專有雲端 API
- IMO / 競賽表現水準
- 奧數前沿水準
DeepSeek-V3.2-Speciale (671B)
- 開發機構
- DeepSeek
- 格式與工具依賴
- 自然語言推理搜尋
- 權重開放性
- 開放權重(671B MoE)
- IMO / 競賽表現水準
- 達到前沿競賽級數學解題水準
| 模型 / 系統 | 開發機構 | 格式與工具依賴 | 權重開放性 | IMO / 競賽表現水準 |
|---|---|---|---|---|
| Nemotron 3 Ultra (IMO Pipeline) | NVIDIA | 純自然語言(無形式化證明器/無工具) | 完全開源(包含檢查點與訓練配方) | IMO 2026 金牌(30/42 分) |
| AlphaProof / AlphaGeometry | Google DeepMind | 形式化語言(Lean)與符號工具輔助 | 閉源 / 專有系統 | IMO 2024 等級銀/金牌水準 |
| Gemini Deep Think | Google DeepMind | 多模態自然語言與內部搜尋 | 閉源 / 專有雲端 API | 奧數前沿水準 |
| DeepSeek-V3.2-Speciale (671B) | DeepSeek | 自然語言推理搜尋 | 開放權重(671B MoE) | 達到前沿競賽級數學解題水準 |
技術深入
- 基礎架構與模型組合:以 NVIDIA Nemotron 3 Ultra 為骨幹,整合基礎模型、
Nemotron-3-Labs-Ultra-Math-SFT(監督式微調專家)與Nemotron-3-Labs-Ultra-Math-RL(強化學習專家)三種檢查點組成協同集成架構。 - 純自然語言無工具推理:不依賴 Lean 或 Isabelle 等機器驗證語言,亦不調用外部程式碼執行器或符號求解器,完全依靠自然語言長鏈條推理生成形式完整且具備嚴謹性的非形式化數學證明。
- 兩階段測試時運算架構(Test-Time Compute):第一階段利用專門檢查點進行反覆候選證明生成、自我驗證批判與迭代修正;第二階段配置高算力篩選機制,對多個候選證明進行獨立打分與排序,選出最終提交解答。
- 開放資源庫規格:所有模型權重依 OpenMDW-1.1 授權釋出,包含開源推論搜尋腳本、完整提交解答日誌,以及全新設計的 200 題奧賽級評測集 Nemotron-IMO-Bench。
前景展望基於引用來源的 AI 分析
非形式化自然語言長推理將逐步取代形式化證明器成為奧數 AI 的主流途徑
Nemotron 3 Ultra 在完全不依賴 Lean 或符號工具的情況下取得 IMO 金牌,證明測試時運算與專業 RL/SFT 能弭平自然語言驗證的幻覺弱點。
開放權重模型搭配測試時運算擴展將加速打破專有前沿實驗室的推理壟斷
NVIDIA 釋出完整訓練配方與推論腳本,讓社群與競爭對手得以在無需超大規模閉源叢集的情況下重現頂級競賽推理能力。
時間線
2026-03
NVIDIA 發布 Nemotron-Cascade 2(30B MoE 架構),於 IMO 2025 與 IOI 2025 達到金牌水準
2026-09
NVIDIA 發布 Nemotron-3-Ultra-CC,針對 IOI 2026 程式競賽推出後訓練強化管線
2026-09
NVIDIA 研究團隊發表論文 arXiv:2609.10712,公布 Nemotron 3 Ultra 達到 IMO 2026 金牌門檻並開源配方
- 2026-03NVIDIA 發布 Nemotron-Cascade 2(30B MoE 架構),於 IMO 2025 與 IOI 2025 達到金牌水準
- 2026-09NVIDIA 發布 Nemotron-3-Ultra-CC,針對 IOI 2026 程式競賽推出後訓練強化管線
- 2026-09NVIDIA 研究團隊發表論文 arXiv:2609.10712,公布 Nemotron 3 Ultra 達到 IMO 2026 金牌門檻並開源配方
來源 (10)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
12609arxiv.org22609huggingface.co32609arxiv.org4Nemotron 3 Labs Ultra Math Rl Imo 2026orcarouter.ai5Nvidia Open Sources Imo Gold Recipe Nemotron 3 Ultra Scores 3042 at Imo 2026 inaiweekly.co6Nemotron 3 Ultra Scores 3042 at Imo 2026 in Natural Languageaiweekly.co7Nvidia Nemotron Cascade 2 Imo Gold Medal 3b Active Parameterstoknow.ai82609arxiv.org92603arxiv.org102603arxiv.org
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週電子報
每週一封,可隨時退訂。