☁️較早收集於 2m

NVIDIA Nemotron 3 Ultra 於 Amazon SageMaker JumpStart 正式上線

NVIDIA Nemotron 3 Ultra 於 Amazon SageMaker JumpStart 正式上線
PostLinkedIn
☁️閱讀原文: AWS Machine Learning Blog

💡在 AWS 上部署 NVIDIA 最新的推理模型,為代理型 AI 帶來 5 倍推論速度與 30% 的成本節省。

⚡ 30-Second TL;DR

有什麼變化

現已可在 Amazon SageMaker JumpStart 上進行部署

為什麼重要

此發布降低了企業在生產環境中部署高效能推理模型的門檻。它特別針對代理型 AI 應用所需的效率需求,這對於自動化業務流程而言正變得至關重要。

下一步行動

在 SageMaker JumpStart 上部署一個 Nemotron 3 Ultra 測試實例,以評估您現有的代理型 AI 工作流程在成本與延遲方面的改善。

誰應關注:Developers & AI Engineers

關鍵要點

  • 現已可在 Amazon SageMaker JumpStart 上進行部署
  • 針對代理型 AI 工作負載提供 5 倍的推論速度提升
  • 相較於先前配置,營運成本降低了 30%

🧠 深度解析

Web-grounded analysis with 28 cited sources.

🔑 增強重點摘要

  • NVIDIA Nemotron 3 Ultra 是一個擁有 5500 億總參數和 550 億活躍參數的混合專家 (MoE) 模型,專為代理型 AI 系統中的前沿推理和協調而設計。
  • 該模型採用混合 Mamba-Attention 架構,利用 LatentMoE 提高準確性,並包含多令牌預測 (MTP) 層,透過原生推測解碼實現更快的推論。
  • Nemotron 3 Ultra 支援高達 100 萬個令牌的上下文長度,在 RULER 等長上下文基準測試中超越了其他最先進的開放式大型語言模型。
  • 該模型以開放權重形式發布,包含權重、資料和訓練配方,使開發人員能夠針對特定領域的工作流程進行客製化和部署。
  • Nemotron 3 Ultra 透過多環境強化學習進行後訓練,使用大量任務解決和工具使用資料集,專為代理主導的開放式協調系統而非單輪聊天進行優化。
📊 競品分析▸ Show
特性/模型NVIDIA Nemotron 3 UltraGLM-5.1-754B-A40BKimi-K2.6-1T-A32BQwen-3.5-397B-17B
總參數5500 億 (550 億活躍)7540 億1 兆3970 億 (170 億活躍)
推論吞吐量 (8k 輸入/64k 輸出)基準模型的 5.9 倍基準基準模型的 1.2 倍基準模型的 3.7 倍
準確性與其他最先進的開放式大型語言模型持平---
上下文長度高達 100 萬個令牌256K (RULER 不適用)256K (RULER 不適用)1M (RULER 90%)
代理型 AI 優化專為前沿推理和協調而建構擅長代理型軟體工程-擅長多語言編碼、指令遵循和長程規劃
美國開放權重模型排名 (Artificial Analysis Intelligence Index)48 分 (美國開放權重模型領導者)-54 分 (中國領先的開放模型)-
Nemotron 3 Super 120B A12B 定價 (每百萬令牌)(Nemotron 3 Ultra 尚未提供公開定價,但 Nemotron 3 Super 的輸入為 $0.090-$0.30,輸出為 $0.450-$0.80,具體取決於供應商)---

🛠️ 技術深入

  • 總參數與活躍參數: Nemotron 3 Ultra 是一個擁有 5500 億總參數的混合專家 (MoE) 模型,其中每個令牌有 550 億活躍參數。
  • 模型架構: 採用混合 Latent Mixture-of-Experts (LatentMoE) 架構,結合了交錯的 Mamba-2 和 MoE 層,以及精選的 Attention 層。
  • 關鍵技術: 包含多令牌預測 (MTP) 層,用於加速文本生成和提高品質,並支援原生推測解碼。
  • 訓練與優化: 使用 NVFP4 預訓練配方進行預訓練,以最大化計算效率。後訓練透過強化學習 (RL)、監督式微調 (SFT) 和多教師在線蒸餾 (MOPD) 增強模型準確性。
  • 上下文處理: 支援高達 100 萬個令牌的上下文長度,Mamba 層提高長上下文工作負載的序列效率,而 Transformer 層在代理需要從大型上下文視窗中檢索特定事實時保持精確召回。
  • 訓練資料: 預訓練基礎建立在 10 兆個令牌之上,並新增了 2120 億個新令牌,目標是三個高價值領域:40 億個合成法律資料、350 億個合成 Wiki 資料,以及用於代理型、推理和通用模型能力的後訓練資料集。
  • 量化: 大多數線性層使用 NVFP4 進行權重、激活和梯度處理,而精選層(包括潛在投影、MTP 層、QKV/注意力投影和嵌入)則保持在 BF16 或 MXFP8 以確保訓練穩定性。

🔮 前景展望AI analysis grounded in cited sources

企業將更廣泛地採用可客製化的開放權重代理型 AI 模型。
Nemotron 3 Ultra 的開放權重特性及其對複雜代理型工作流程的優化,加上在 SageMaker JumpStart 等平台上的可用性,鼓勵企業為內部用例建構專業化、可檢查和可微調的 AI 代理。
開放權重大型語言模型領域的競爭將加劇,特別是在代理型功能方面。
NVIDIA 將 Nemotron 3 Ultra 作為領先的開放權重代理型 AI 模型發布,並與其他開放模型進行性能基準測試,這預示著其將推動主導這一細分市場,促使其他開發商和公司在開源 AI 領域進一步創新。
AI 代理系統將朝向結合前沿推理模型與更小、更高效模型的混合架構發展。
Nemotron 3 Ultra 被設計為複雜任務的「規劃/推理層」,這表明它將與更小、更高效的模型配對以執行常規子代理工作,從而產生更複雜且具成本效益的多代理架構。

時間線

2023-11
NVIDIA 推出 Nemotron-3 8B,用於企業聊天機器人和協作開發。
2024-02
NVIDIA 發布 Nemotron-4 15B 技術報告。
2024-06
NVIDIA 推出 Nemotron-4 340B 系列模型。
2025-09
NVIDIA 將 Nemotron 定位為代理型系統的開放堆疊,包含模型、訓練資料和工具。
2025-12
NVIDIA 宣布推出 Nemotron 3 系列模型 (Nano, Super, Ultra),採用混合 Mamba-Transformer 架構。
2026-02
NVIDIA Nemotron 3 Nano 30B 模型在 Amazon SageMaker JumpStart 上普遍可用。
2026-04
NVIDIA Nemotron-3-Super-120B 和 Nemotron 3 Nano Omni 模型在 Amazon SageMaker JumpStart 上可用。
2026-06
NVIDIA Nemotron 3 Ultra 正式發布並透過 Amazon SageMaker JumpStart 提供部署。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog