🟩NVIDIA Developer Blog•較早收集於 28m
NVIDIA Nemotron 3 Ultra 優化長週期 AI 代理推理效能

💡了解 NVIDIA 如何透過新模型減少複雜多輪 AI 代理的 Token 冗餘問題。
⚡ 30-Second TL;DR
有什麼變化
針對需要多輪推理的長週期代理進行最佳化
為什麼重要
此模型協助開發者建構更複雜、自主的代理,而無需承擔高額 Token 消耗帶來的成本。它能在生產環境中實現更可靠的多代理協作。
下一步行動
評估您目前多代理工作流程的 Token 使用量,並使用 Nemotron 3 Ultra 進行基準測試,以確認是否能降低您的推理成本。
誰應關注:Developers & AI Engineers
關鍵要點
- •針對需要多輪推理的長週期代理進行最佳化
- •減少涉及子代理與工具調用的複雜工作流程中的 Token 開銷
- •在長時間的互動週期中保持上下文處理效率
🧠 深度解析
Web-grounded analysis with 14 cited sources.
🔑 增強重點摘要
- •NVIDIA Nemotron 3 Ultra 是一個擁有 550B 總參數的混合 Mamba-Transformer 專家混合 (MoE) 模型,每個 Token 最多激活 55B 參數,旨在提供高效能的 AI 代理推理。
- •該模型支援高達 1M Token 的上下文長度,這得益於 Mamba-2 層提供的線性時間複雜度,使其在處理長文檔和代理工作負載時更具實用性。
- •Nemotron 3 Ultra 在 NVIDIA GB200 NVL72 上實現了高達 5 倍的峰值吞吐量,並在多種代理任務中展現領先的準確性,超越了同類型的 GLM-4.5-355B-A32B 和 Kimi-K2-1026B-A33B 等模型。
- •作為一個預訓練基礎檢查點,Nemotron 3 Ultra 旨在作為客製化的最佳起點,允許企業進行領域數據微調、強化學習後訓練和客製化指令微調,而非開箱即用的助理模型。
- •Nemotron 3 Ultra 採用開放權重授權,允許商業使用,使企業能夠在自有基礎設施上進行自託管、微調,並實現成本透明化。
📊 競品分析▸ Show
| 特性/模型 | NVIDIA Nemotron 3 Ultra | Kimi K2.6 | GLM-4.5-355B-A32B | Claude Opus 4.7 |
|---|---|---|---|---|
| 模型類型 | 開放權重 (MoE) | 開放權重 | 開放權重 | 閉源 |
| 參數規模 | 550B 總參數 (55B 活躍) | 未明確 (中國領先模型) | 355B 參數 | 未明確 (前沿模型) |
| 上下文長度 | 1M Token | 256K Token | 256K Token | 1M Token |
| 代理任務基準 (PinchBench) | 91% | 91% | 84% | 未明確 (但以一致性著稱) |
| 推理速度 (TPS) | 高達 5 倍於 GLM | 50-100 TPS (市場上) | 1 倍於 Ultra (基準) | 未明確 (但有延遲考慮) |
| 授權/成本 | 開放權重,允許商用,自託管成本 | 開放權重,自託管成本 | 開放權重,自託管成本 | API 訂閱,按 Token 計費 |
🛠️ 技術深入
- 模型架構: 混合 Mamba-Transformer 專家混合 (MoE) 架構。
- 參數規模: 550B 總參數,每個 Token 最多激活 55B 參數。
- 上下文長度: 支援 1M Token 的上下文長度,由 Mamba-2 層提供線性時間複雜度。
- 優化技術:
- LatentMoE: 在路由前將 Token 壓縮到低秩潛在空間,以相同的推理成本實現 4 倍的專家數量。
- Multi-Token Prediction (MTP): 在單次前向傳播中預測多個未來 Token,提高思維鏈連貫性並實現內建的推測解碼。
- NVFP4 量化: 使用 NVFP4 進行預訓練,以實現更高的推理性能。
- 硬體優化: 針對 NVIDIA H100 和 Blackwell GPU 架構進行優化,包括張量並行、記憶體頻寬利用和注意力計算。
- 訓練階段: 作為預訓練基礎檢查點發布,未經指令微調或後訓練對齊,旨在作為客製化的起點。
- 部署支援: 可透過 vLLM、SGLang、Ollama 和 llama.cpp 等開放框架部署,並作為 NVIDIA NIM 微服務提供。
🔮 前景展望AI analysis grounded in cited sources
加速企業級AI代理的普及與客製化。
Nemotron 3 Ultra 作為開放權重模型,允許企業在自有基礎設施上進行微調和部署,解決數據隱私和成本透明問題,從而加速其在特定領域的應用。
強化 NVIDIA 作為全棧 AI 公司的市場地位。
透過發布領先的開放模型,NVIDIA 不僅是硬體供應商,更是 AI 生態系統的關鍵參與者,提升開發者好感度並擴大其影響力。
促進 AI 代理系統的效率與複雜性提升。
該模型專為長週期、多步驟的代理工作流程設計,結合了高效的架構和百萬級 Token 上下文,將使 AI 代理能夠處理更複雜、更需要深度推理的任務。
⏳ 時間線
2023-11
NVIDIA 推出 Nemotron-3 8B,用於企業聊天機器人開發。
2024-06
NVIDIA 推出 Nemotron-4 340B 系列,用於合成數據生成和指令微調。
2025-01
NVIDIA 在 CES 2025 宣布 Llama Nemotron 系列推理模型,針對企業推理和代理 AI 任務。
2025-12
NVIDIA 宣布 Nemotron 3 系列模型(Nano, Super, Ultra),並發布 Nemotron 3 Nano 模型。
2026-03
NVIDIA 發布 Nemotron 3 Super 的技術報告,並成立 Nemotron Coalition。
2026-06-01
NVIDIA 正式發布 Nemotron 3 Ultra,作為其最強大的開放權重 AI 模型。
📎 來源 (14)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog ↗


