Nemotron 3 Omni 即將推出?

💡Nvidia Nemotron 3 Omni 傳聞:NVFP4 挑戰 Qwen3.5?本地推論關鍵
⚡ 30-Second TL;DR
有什麼變化
在 Nvidia keynote 中被發現
為什麼重要
若推出 NVFP4,將優化 Nvidia 硬體推論,挑戰領先開源模型。
下一步行動
關注 Nvidia 開發者部落格,追蹤 Nemotron 3 Omni 新聞稿及早期存取。
關鍵要點
- •在 Nvidia keynote 中被發現
- •一小時前發布新聞稿
- •可能支援 NVFP4 量化
- •定位為 Qwen3.5 競爭對手
- •規模類似 Nemotron 3 Super
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 8 個來源。
🔑 增強重點摘要
- •NVIDIA Nemotron 3 Super 已於2026年3月11日正式發布,採用混合Mamba-Transformer MoE架構,擁有120B總參數但僅12B活躍參數,在Artificial Analysis效率排名中位居首位[1][2]
- •Nemotron 3 Super在NVIDIA Blackwell平台上使用NVFP4精度運行,相比Hopper平台的FP8推理速度快4倍,記憶體需求大幅降低[2][3]
- •該模型具備100萬token上下文窗口,支援多token預測(MTP)實現3倍更快推理,並在DeepResearch Bench和DeepResearch Bench II排行榜上將NVIDIA AI-Q研究代理推至第一位[2]
- •Perplexity已成為首個合作夥伴向用戶提供Nemotron 3 Super的訪問權限,用於自主代理任務[4]
- •搜索結果中未發現關於'Nemotron 3 Omni'的任何官方公告或確認信息,該產品名稱目前僅存在於Reddit推測中,無法驗證其存在性或發布計畫[1][2][3][4][5]
📊 競品分析▸ Show
| 特性 | Nemotron 3 Super | Qwen3.5 | GPT-OSS-120B |
|---|---|---|---|
| 總參數 | 120B | 未知 | 120B |
| 活躍參數 | 12B | 未知 | 全部 |
| 架構 | 混合Mamba-Transformer MoE | 未知 | 標準Transformer |
| 上下文窗口 | 100萬token | 未知 | 未知 |
| 推理吞吐量 | 相比GPT-OSS-120B提升2.2倍[6] | 未知 | 基準 |
| 精度 | NVFP4(Blackwell) | 未知 | 未知 |
🛠️ 技術深入
• LatentMoE架構:採用新型潛在空間專家路由機制,將token投影到較小的潛在維度進行專家計算和路由,提升每字節精度[7] • 混合骨幹網路:交錯使用Mamba-2層和MoE層,搭配選定的Attention層,Mamba層提供4倍記憶體和計算效率提升[5] • NVFP4預訓練:首個採用NVFP4量化預訓練的Nemotron 3系列模型,大多數線性層使用NVFP4用於權重、激活和梯度,部分層(潛在投影、MTP層、QKV/attention投影、嵌入)保持BF16或MXFP8以確保訓練穩定性[7] • 多Token預測(MTP)層:支援同時預測多個未來詞彙,實現3倍更快推理[2] • 推理優化:在NVIDIA B200 GPU上使用vLLM和TRT-LLM測試,8k輸入序列和64k輸出序列長度下,吞吐量相比Qwen3.5-122B提升7.5倍[6] • 張量並行配置:支援張量並行大小2或4,最大模型長度65,536,最大批處理token 32,768,使用FLASH_ATTN注意力後端[1]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
📎 來源 (8)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- artificialanalysis.ai — Nvidia Nemotron 3 Super the New Leader in Open Efficient Intelligence
- blogs.nvidia.com — Nemotron 3 Super Agentic AI
- siliconangle.com — Nvidias Nemotron Super 3 Model Agentic Systems Launches Five Times Higher Throughput
- techbuzz.ai — Nvidia Nemotron 3 Super Hits 5x Throughput for Agentic AI
- developer.nvidia.com — Introducing Nemotron 3 Super an Open Hybrid Mamba Transformer Moe for Agentic Reasoning
- research.nvidia.com — Nvidia Nemotron 3 Super Technical Report
- Hugging Face — Nvidia Nemotron 3 Super 120b A12b Bf16
- aiagentsdirectory.com — Nvidia Nemotron 3 Super Everything You Need to Know
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
