🏠較早收集於 2m

英偉達 Nemotron 3 Ultra 吞吐量效率提升 5 倍

英偉達 Nemotron 3 Ultra 吞吐量效率提升 5 倍
PostLinkedIn
🏠閱讀原文: IT之家
#multimodal#robotics#medical-ainemotron-3-ultranvidianemotron-3-ultrablackwellgr00tbionemo

💡英偉達開源 Nemotron 以 5 倍效率突破智能體與機器人瓶頸。(38字元)

⚡ 30-Second TL;DR

有什麼變化

Nemotron 3 Ultra 在 Blackwell 架構上實現 5 倍吞吐量效率,用於智能體 AI。

為什麼重要

這些開源模型降低開發者建構智能體、機器人和醫療 AI 的門檻,有望加速各產業創新。CrowdStrike 和 ServiceNow 等企業採用顯示已具生產就緒性。

下一步行動

從 Hugging Face 下載 Nemotron 3 Ultra,並在 Blackwell GPU 上基準測試吞吐量。

誰應關注:Developers & AI Engineers

關鍵要點

  • Nemotron 3 Ultra 在 Blackwell 架構上實現 5 倍吞吐量效率,用於智能體 AI。
  • Cosmos 3 統一合成世界生成與動作仿真,適用於物理 AI。
  • Isaac GR00T N1.7 和 Alpamayo 1.5 準備好用於人形機器人和自動駕駛。
  • BioNeMo Proteina-Complexa 加速蛋白質藥物發現;nvQSP 仿真提速 77 倍。
  • GR00T N2 在新環境中任務成功率翻倍,預計年底上線。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • NVIDIA Nemotron 3 Super 採用混合 Mamba-Transformer 架構,結合稀疏專家混合(MoE)技術,在 8k 輸入/16k 輸出設定下相比 GPT-OSS-120B 和 Qwen3.5-122B 分別實現 2.2 倍和 7.5 倍的吞吐量提升[2]
  • 模型支援高達 100 萬個 token 的上下文長度,使自主代理能夠在記憶體中保留完整工作流狀態,並在 RULER 基準測試中超越同級競爭對手[3]
  • Nemotron 3 Super 在 NVIDIA Blackwell 平台上採用 NVFP4 精度預訓練,相比 NVIDIA Hopper 上的 FP8 推理速度快 4 倍,同時不損失準確度[3]
  • 模型內建多 token 預測(MTP)層,透過在單次前向傳遞中預測多個未來 token,為結構化生成任務(如程式碼和工具呼叫)提供高達 3 倍的牆鐘時間加速,無需單獨的草稿模型[4]
  • Nemotron 3 Super 在 PinchBench 基準測試中得分 85.6%,成為其類別中最佳開源模型,並在 DeepResearch Bench 和 DeepResearch Bench II 排行榜上推動 NVIDIA AI-Q 研究代理排名第一[3]
📊 競品分析▸ Show
特性Nemotron 3 SuperGPT-OSS-120BQwen3.5-122B
總參數量120B(12B 活躍)120B122B
最大上下文長度100 萬 token未指定未指定
吞吐量(8k/16k)基準2.2 倍低7.5 倍低
架構混合 Mamba-Transformer MoE標準 Transformer標準 Transformer
推理加速MTP 提供 3 倍加速
精度支援NVFP4、FP8、BF16標準精度標準精度

🛠️ 技術深入

混合架構:Mamba 層提供 4 倍的記憶體和計算效率,Transformer 層驅動高級推理能力[3]稀疏 LatentMoE:新技術以一個專家的成本激活四個專家,改進準確度[2]多 Token 預測(MTP):同時預測多個未來詞彙,實現結構化生成任務 3 倍加速[4]NVFP4 預訓練:針對 NVIDIA Blackwell 最佳化,相比 Hopper 上的 FP8 推理速度快 4 倍[3]推理配置:張量並行大小 2-4、最大模型長度 65,536、GPU 記憶體利用率 90%、最大批次 token 32,768[1]預訓練語料庫:25 兆 token 語料庫[5]強化學習後訓練:跨 21 個環境配置進行多環境 RL 後訓練,超過 120 萬次環境展開[4]

🔮 前景展望AI analysis grounded in cited sources

Nemotron 3 Super 將成為自主代理和多步驟推理任務的標準基礎模型
100 萬 token 上下文長度和內建推理能力使其特別適合長期運行的自主代理,在 DeepResearch Bench 排行榜上的領先地位驗證了這一點。
混合 Mamba-Transformer 架構將推動開源模型中效率-準確度權衡的重新定義
Nemotron 3 Super 在保持或超越競爭對手準確度的同時實現 2.2-7.5 倍吞吐量提升,表明該架構方法可能成為大規模推理系統的新標準。
NVFP4 精度標準化將加速邊緣部署和成本優化
在 Blackwell 上實現 4 倍推理加速且無準確度損失,可能促使企業升級硬體基礎設施並重新評估量化策略。

時間線

2024-12
NVIDIA 推出 Nemotron 3 Nano,引入混合 Mamba-Transformer 架構
2025-03
NVIDIA 發佈 Nemotron 3 系列技術報告,詳細說明 LatentMoE 和 MTP 創新
2026-03
NVIDIA 在 GTC 2026 推出 Nemotron 3 Super,實現 5 倍吞吐量效率提升,支援 100 萬 token 上下文
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。