🟩較早收集於 28m

NVIDIA Nemotron 3 Ultra 優化長週期 AI 代理推理效能

NVIDIA Nemotron 3 Ultra 優化長週期 AI 代理推理效能
PostLinkedIn
🟩閱讀原文: NVIDIA Developer Blog

💡了解 NVIDIA 如何透過新模型減少複雜多輪 AI 代理的 Token 冗餘問題。

⚡ 30-Second TL;DR

有什麼變化

針對需要多輪推理的長週期代理進行最佳化

為什麼重要

此模型協助開發者建構更複雜、自主的代理,而無需承擔高額 Token 消耗帶來的成本。它能在生產環境中實現更可靠的多代理協作。

下一步行動

評估您目前多代理工作流程的 Token 使用量,並使用 Nemotron 3 Ultra 進行基準測試,以確認是否能降低您的推理成本。

誰應關注:Developers & AI Engineers

關鍵要點

  • 針對需要多輪推理的長週期代理進行最佳化
  • 減少涉及子代理與工具調用的複雜工作流程中的 Token 開銷
  • 在長時間的互動週期中保持上下文處理效率

🧠 深度解析

Web-grounded analysis with 14 cited sources.

🔑 增強重點摘要

  • NVIDIA Nemotron 3 Ultra 是一個擁有 550B 總參數的混合 Mamba-Transformer 專家混合 (MoE) 模型,每個 Token 最多激活 55B 參數,旨在提供高效能的 AI 代理推理。
  • 該模型支援高達 1M Token 的上下文長度,這得益於 Mamba-2 層提供的線性時間複雜度,使其在處理長文檔和代理工作負載時更具實用性。
  • Nemotron 3 Ultra 在 NVIDIA GB200 NVL72 上實現了高達 5 倍的峰值吞吐量,並在多種代理任務中展現領先的準確性,超越了同類型的 GLM-4.5-355B-A32B 和 Kimi-K2-1026B-A33B 等模型。
  • 作為一個預訓練基礎檢查點,Nemotron 3 Ultra 旨在作為客製化的最佳起點,允許企業進行領域數據微調、強化學習後訓練和客製化指令微調,而非開箱即用的助理模型。
  • Nemotron 3 Ultra 採用開放權重授權,允許商業使用,使企業能夠在自有基礎設施上進行自託管、微調,並實現成本透明化。
📊 競品分析▸ Show
特性/模型NVIDIA Nemotron 3 UltraKimi K2.6GLM-4.5-355B-A32BClaude Opus 4.7
模型類型開放權重 (MoE)開放權重開放權重閉源
參數規模550B 總參數 (55B 活躍)未明確 (中國領先模型)355B 參數未明確 (前沿模型)
上下文長度1M Token256K Token256K Token1M Token
代理任務基準 (PinchBench)91%91%84%未明確 (但以一致性著稱)
推理速度 (TPS)高達 5 倍於 GLM50-100 TPS (市場上)1 倍於 Ultra (基準)未明確 (但有延遲考慮)
授權/成本開放權重,允許商用,自託管成本開放權重,自託管成本開放權重,自託管成本API 訂閱,按 Token 計費

🛠️ 技術深入

  • 模型架構: 混合 Mamba-Transformer 專家混合 (MoE) 架構。
  • 參數規模: 550B 總參數,每個 Token 最多激活 55B 參數。
  • 上下文長度: 支援 1M Token 的上下文長度,由 Mamba-2 層提供線性時間複雜度。
  • 優化技術:
    • LatentMoE: 在路由前將 Token 壓縮到低秩潛在空間,以相同的推理成本實現 4 倍的專家數量。
    • Multi-Token Prediction (MTP): 在單次前向傳播中預測多個未來 Token,提高思維鏈連貫性並實現內建的推測解碼。
    • NVFP4 量化: 使用 NVFP4 進行預訓練,以實現更高的推理性能。
    • 硬體優化: 針對 NVIDIA H100 和 Blackwell GPU 架構進行優化,包括張量並行、記憶體頻寬利用和注意力計算。
  • 訓練階段: 作為預訓練基礎檢查點發布,未經指令微調或後訓練對齊,旨在作為客製化的起點。
  • 部署支援: 可透過 vLLM、SGLang、Ollama 和 llama.cpp 等開放框架部署,並作為 NVIDIA NIM 微服務提供。

🔮 前景展望AI analysis grounded in cited sources

加速企業級AI代理的普及與客製化。
Nemotron 3 Ultra 作為開放權重模型,允許企業在自有基礎設施上進行微調和部署,解決數據隱私和成本透明問題,從而加速其在特定領域的應用。
強化 NVIDIA 作為全棧 AI 公司的市場地位。
透過發布領先的開放模型,NVIDIA 不僅是硬體供應商,更是 AI 生態系統的關鍵參與者,提升開發者好感度並擴大其影響力。
促進 AI 代理系統的效率與複雜性提升。
該模型專為長週期、多步驟的代理工作流程設計,結合了高效的架構和百萬級 Token 上下文,將使 AI 代理能夠處理更複雜、更需要深度推理的任務。

時間線

2023-11
NVIDIA 推出 Nemotron-3 8B,用於企業聊天機器人開發。
2024-06
NVIDIA 推出 Nemotron-4 340B 系列,用於合成數據生成和指令微調。
2025-01
NVIDIA 在 CES 2025 宣布 Llama Nemotron 系列推理模型,針對企業推理和代理 AI 任務。
2025-12
NVIDIA 宣布 Nemotron 3 系列模型(Nano, Super, Ultra),並發布 Nemotron 3 Nano 模型。
2026-03
NVIDIA 發布 Nemotron 3 Super 的技術報告,並成立 Nemotron Coalition。
2026-06-01
NVIDIA 正式發布 Nemotron 3 Ultra,作為其最強大的開放權重 AI 模型。

📎 來源 (14)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. github.com
  2. coaleypeak.co.uk
  3. nvidia.com
  4. substack.com
  5. nvidia.com
  6. reddit.com
  7. mindstudio.ai
  8. benchlm.ai
  9. artificialanalysis.ai
  10. the-decoder.com
  11. softcery.com
  12. intellectia.ai
  13. github.com
  14. nvidia.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog