🟢較早收集於 30m

NVIDIA Nemotron 3 Super:代理式 AI 5 倍吞吐量

NVIDIA Nemotron 3 Super:代理式 AI 5 倍吞吐量
PostLinkedIn
🟢閱讀原文: NVIDIA Blog
#agentic-ai#open-model#high-throughputnemotron-3-supernvidianemotron-3-superperplexity

💡NVIDIA 1200 億開放模型:代理式 AI 5 倍吞吐量 – 高效擴展自主代理。(38 字元)

⚡ 30-Second TL;DR

有什麼變化

1200 億總參數,120 億活躍參數提升效率

為什麼重要

此推出加速代理式 AI 採用,提供高吞吐量開放模型,降低開發者推理成本。它強化 NVIDIA 在開源 AI 的地位,讓企業能擴展自主系統。

下一步行動

透過 Perplexity 存取 Nemotron 3 Super,並在其上基準測試您的代理式 AI 任務吞吐量。

誰應關注:Developers & AI Engineers

關鍵要點

  • 1200 億總參數,120 億活躍參數提升效率
  • 代理式 AI 系統 5 倍更高吞吐量
  • 開放模型今日推出並即刻可用
  • 先進推理支援自主代理任務
  • Perplexity 整合供用戶存取

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Nemotron 3 Super採用混合Mamba-Transformer MoE架構,結合Mamba層用於高效序列建模、Transformer層用於精密推理,以及MoE路由用於可擴展計算效率[5]
  • Nemotron 3 Super和Ultra使用NVIDIA的4位NVFP4精度格式在Blackwell架構上訓練,顯著降低記憶體需求並加速訓練,同時不損害準確度[1][3]
  • Nemotron 3 Nano相比Nemotron 2 Nano實現4倍更高的令牌吞吐量,並在推理令牌生成方面減少60%[4],Super和Ultra預計在2026年上半年推出[5]
  • Nemotron 3系列支援100萬令牌上下文窗口,使代理能夠在單一上下文中保留完整證據集、歷史緩衝區和多階段計劃,無需依賴分片啟發式方法[5]
  • Nemotron 3 Super針對協作代理和高容量工作負載(如IT票證自動化)進行優化,具有約100億參數和每令牌最多10億活躍參數[1][2]
📊 競品分析▸ Show
特性Nemotron 3 SuperGPT-OSS-20BQwen3-30B-A3B-Thinking-2507
總參數~100B20B30B
活躍參數~10B全部全部
推理準確度優於兩者[2]基準基準
吞吐量效率3.3倍高於Qwen3[2]2.2倍低於Nano[2]3.3倍低於Nano[2]
架構混合Mamba-Transformer MoE[5]標準Transformer標準Transformer
上下文窗口100萬令牌[5]未指定未指定

🛠️ 技術深入

架構創新

  • 混合Mamba-Transformer MoE骨幹整合三種架構:Mamba層用於高效序列建模,Transformer層用於精密推理,MoE路由用於可擴展計算[5]
  • Mamba層以最小記憶體開銷追蹤長距離依賴,即使處理數十萬令牌也能維持性能[5]

訓練與優化

  • 採用NVIDIA的4位NVFP4精度格式在Blackwell架構上訓練[1][3]
  • Super和Ultra採用Latent MoE(一種新穎的硬體感知專家設計)以提高準確度[2]
  • Super和Ultra納入多令牌預測(MTP)層以改進長文本生成效率和模型品質[2]

推理能力

  • 100萬令牌上下文窗口支援跨大型程式碼庫、長文件、延伸對話和聚合檢索內容的持續推理[5]
  • Nemotron 3 Nano在8K輸入/16K輸出設定下,使用單個H200時的推理吞吐量比Qwen3-30B-A3B高3.3倍,比GPT-OSS-20B高2.2倍[2]

參數配置

  • Nemotron 3 Nano:30B總參數,3B活躍參數[3]
  • Nemotron 3 Super:~100B總參數,~10B活躍參數[1]
  • Nemotron 3 Ultra:~500B總參數,~50B活躍參數[1]

🔮 前景展望AI analysis grounded in cited sources

Nemotron 3 Super將成為企業多代理自動化的標準基礎模型
其針對協作代理和高容量工作負載(如IT票證自動化)的優化,加上相對於Ultra的較低計算需求,使其成為企業部署的理想選擇[1][2]
混合MoE架構將重新定義開放模型的效率標準
Nemotron 3相比Nemotron 2實現4倍吞吐量提升,同時維持或超越標準Transformer的準確度,可能促使業界採用類似的混合架構設計[1][3]
100萬令牌上下文窗口將推動實時物理AI應用的發展
該容量使代理能夠在單一上下文中保留完整技術手冊或數週的操作數據,支援需要即時反應和深度推理的複雜工作流[5][6]

時間線

2025-12
NVIDIA發佈Nemotron 3系列公告,包括Nano、Super和Ultra三種規格[4]
2026-01
NVIDIA在CES 2026展示Nemotron 3,強調其作為物理AI時代代理式大腦的角色[6]
2026-03
Nemotron 3 Nano正式推出並立即可用,Perplexity整合該模型供用戶存取
2026-H1
Nemotron 3 Super和Ultra預計在2026年上半年推出,包含Latent MoE和多令牌預測增強[5]
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Blog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。