☁️AWS Machine Learning Blog•較早收集於 2m
NVIDIA Nemotron 3 Ultra 於 Amazon SageMaker JumpStart 正式上線

💡在 AWS 上部署 NVIDIA 最新的推理模型,為代理型 AI 帶來 5 倍推論速度與 30% 的成本節省。
⚡ 30-Second TL;DR
有什麼變化
現已可在 Amazon SageMaker JumpStart 上進行部署
為什麼重要
此發布降低了企業在生產環境中部署高效能推理模型的門檻。它特別針對代理型 AI 應用所需的效率需求,這對於自動化業務流程而言正變得至關重要。
下一步行動
在 SageMaker JumpStart 上部署一個 Nemotron 3 Ultra 測試實例,以評估您現有的代理型 AI 工作流程在成本與延遲方面的改善。
誰應關注:Developers & AI Engineers
關鍵要點
- •現已可在 Amazon SageMaker JumpStart 上進行部署
- •針對代理型 AI 工作負載提供 5 倍的推論速度提升
- •相較於先前配置,營運成本降低了 30%
🧠 深度解析
Web-grounded analysis with 28 cited sources.
🔑 增強重點摘要
- •NVIDIA Nemotron 3 Ultra 是一個擁有 5500 億總參數和 550 億活躍參數的混合專家 (MoE) 模型,專為代理型 AI 系統中的前沿推理和協調而設計。
- •該模型採用混合 Mamba-Attention 架構,利用 LatentMoE 提高準確性,並包含多令牌預測 (MTP) 層,透過原生推測解碼實現更快的推論。
- •Nemotron 3 Ultra 支援高達 100 萬個令牌的上下文長度,在 RULER 等長上下文基準測試中超越了其他最先進的開放式大型語言模型。
- •該模型以開放權重形式發布,包含權重、資料和訓練配方,使開發人員能夠針對特定領域的工作流程進行客製化和部署。
- •Nemotron 3 Ultra 透過多環境強化學習進行後訓練,使用大量任務解決和工具使用資料集,專為代理主導的開放式協調系統而非單輪聊天進行優化。
📊 競品分析▸ Show
| 特性/模型 | NVIDIA Nemotron 3 Ultra | GLM-5.1-754B-A40B | Kimi-K2.6-1T-A32B | Qwen-3.5-397B-17B |
|---|---|---|---|---|
| 總參數 | 5500 億 (550 億活躍) | 7540 億 | 1 兆 | 3970 億 (170 億活躍) |
| 推論吞吐量 (8k 輸入/64k 輸出) | 基準模型的 5.9 倍 | 基準 | 基準模型的 1.2 倍 | 基準模型的 3.7 倍 |
| 準確性 | 與其他最先進的開放式大型語言模型持平 | - | - | - |
| 上下文長度 | 高達 100 萬個令牌 | 256K (RULER 不適用) | 256K (RULER 不適用) | 1M (RULER 90%) |
| 代理型 AI 優化 | 專為前沿推理和協調而建構 | 擅長代理型軟體工程 | - | 擅長多語言編碼、指令遵循和長程規劃 |
| 美國開放權重模型排名 (Artificial Analysis Intelligence Index) | 48 分 (美國開放權重模型領導者) | - | 54 分 (中國領先的開放模型) | - |
| Nemotron 3 Super 120B A12B 定價 (每百萬令牌) | (Nemotron 3 Ultra 尚未提供公開定價,但 Nemotron 3 Super 的輸入為 $0.090-$0.30,輸出為 $0.450-$0.80,具體取決於供應商) | - | - | - |
🛠️ 技術深入
- 總參數與活躍參數: Nemotron 3 Ultra 是一個擁有 5500 億總參數的混合專家 (MoE) 模型,其中每個令牌有 550 億活躍參數。
- 模型架構: 採用混合 Latent Mixture-of-Experts (LatentMoE) 架構,結合了交錯的 Mamba-2 和 MoE 層,以及精選的 Attention 層。
- 關鍵技術: 包含多令牌預測 (MTP) 層,用於加速文本生成和提高品質,並支援原生推測解碼。
- 訓練與優化: 使用 NVFP4 預訓練配方進行預訓練,以最大化計算效率。後訓練透過強化學習 (RL)、監督式微調 (SFT) 和多教師在線蒸餾 (MOPD) 增強模型準確性。
- 上下文處理: 支援高達 100 萬個令牌的上下文長度,Mamba 層提高長上下文工作負載的序列效率,而 Transformer 層在代理需要從大型上下文視窗中檢索特定事實時保持精確召回。
- 訓練資料: 預訓練基礎建立在 10 兆個令牌之上,並新增了 2120 億個新令牌,目標是三個高價值領域:40 億個合成法律資料、350 億個合成 Wiki 資料,以及用於代理型、推理和通用模型能力的後訓練資料集。
- 量化: 大多數線性層使用 NVFP4 進行權重、激活和梯度處理,而精選層(包括潛在投影、MTP 層、QKV/注意力投影和嵌入)則保持在 BF16 或 MXFP8 以確保訓練穩定性。
🔮 前景展望AI analysis grounded in cited sources
企業將更廣泛地採用可客製化的開放權重代理型 AI 模型。
Nemotron 3 Ultra 的開放權重特性及其對複雜代理型工作流程的優化,加上在 SageMaker JumpStart 等平台上的可用性,鼓勵企業為內部用例建構專業化、可檢查和可微調的 AI 代理。
開放權重大型語言模型領域的競爭將加劇,特別是在代理型功能方面。
NVIDIA 將 Nemotron 3 Ultra 作為領先的開放權重代理型 AI 模型發布,並與其他開放模型進行性能基準測試,這預示著其將推動主導這一細分市場,促使其他開發商和公司在開源 AI 領域進一步創新。
AI 代理系統將朝向結合前沿推理模型與更小、更高效模型的混合架構發展。
Nemotron 3 Ultra 被設計為複雜任務的「規劃/推理層」,這表明它將與更小、更高效的模型配對以執行常規子代理工作,從而產生更複雜且具成本效益的多代理架構。
⏳ 時間線
2023-11
NVIDIA 推出 Nemotron-3 8B,用於企業聊天機器人和協作開發。
2024-02
NVIDIA 發布 Nemotron-4 15B 技術報告。
2024-06
NVIDIA 推出 Nemotron-4 340B 系列模型。
2025-09
NVIDIA 將 Nemotron 定位為代理型系統的開放堆疊,包含模型、訓練資料和工具。
2025-12
NVIDIA 宣布推出 Nemotron 3 系列模型 (Nano, Super, Ultra),採用混合 Mamba-Transformer 架構。
2026-02
NVIDIA Nemotron 3 Nano 30B 模型在 Amazon SageMaker JumpStart 上普遍可用。
2026-04
NVIDIA Nemotron-3-Super-120B 和 Nemotron 3 Nano Omni 模型在 Amazon SageMaker JumpStart 上可用。
2026-06
NVIDIA Nemotron 3 Ultra 正式發布並透過 Amazon SageMaker JumpStart 提供部署。
📎 來源 (28)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- nvidia.com
- nvidia.com
- huggingface.co
- ollama.com
- nvidia.com
- substack.com
- medium.com
- arxiv.org
- coaleypeak.co.uk
- nvidia.com
- nvidia.com
- amazon.com
- westloop.io
- amazon.com
- the-decoder.com
- artificialanalysis.ai
- pricepertoken.com
- tokencost.app
- deepinfra.com
- technewsworld.com
- axiomstudio.ai
- intellectia.ai
- wikipedia.org
- youtube.com
- nvidia.com
- amazon.com
- amazon.com
- nvidia.com
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog ↗
