🦙較早收集於 2h

Nemotron 3 Omni 即將推出?

Nemotron 3 Omni 即將推出?
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡Nvidia Nemotron 3 Omni 傳聞:NVFP4 挑戰 Qwen3.5?本地推論關鍵

⚡ 30-Second TL;DR

有什麼變化

在 Nvidia keynote 中被發現

為什麼重要

若推出 NVFP4,將優化 Nvidia 硬體推論,挑戰領先開源模型。

下一步行動

關注 Nvidia 開發者部落格,追蹤 Nemotron 3 Omni 新聞稿及早期存取。

誰應關注:Developers & AI Engineers

關鍵要點

  • 在 Nvidia keynote 中被發現
  • 一小時前發布新聞稿
  • 可能支援 NVFP4 量化
  • 定位為 Qwen3.5 競爭對手
  • 規模類似 Nemotron 3 Super

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • NVIDIA Nemotron 3 Super 已於2026年3月11日正式發布,採用混合Mamba-Transformer MoE架構,擁有120B總參數但僅12B活躍參數,在Artificial Analysis效率排名中位居首位[1][2]
  • Nemotron 3 Super在NVIDIA Blackwell平台上使用NVFP4精度運行,相比Hopper平台的FP8推理速度快4倍,記憶體需求大幅降低[2][3]
  • 該模型具備100萬token上下文窗口,支援多token預測(MTP)實現3倍更快推理,並在DeepResearch Bench和DeepResearch Bench II排行榜上將NVIDIA AI-Q研究代理推至第一位[2]
  • Perplexity已成為首個合作夥伴向用戶提供Nemotron 3 Super的訪問權限,用於自主代理任務[4]
  • 搜索結果中未發現關於'Nemotron 3 Omni'的任何官方公告或確認信息,該產品名稱目前僅存在於Reddit推測中,無法驗證其存在性或發布計畫[1][2][3][4][5]
📊 競品分析▸ Show
特性Nemotron 3 SuperQwen3.5GPT-OSS-120B
總參數120B未知120B
活躍參數12B未知全部
架構混合Mamba-Transformer MoE未知標準Transformer
上下文窗口100萬token未知未知
推理吞吐量相比GPT-OSS-120B提升2.2倍[6]未知基準
精度NVFP4(Blackwell)未知未知

🛠️ 技術深入

LatentMoE架構:採用新型潛在空間專家路由機制,將token投影到較小的潛在維度進行專家計算和路由,提升每字節精度[7]混合骨幹網路:交錯使用Mamba-2層和MoE層,搭配選定的Attention層,Mamba層提供4倍記憶體和計算效率提升[5]NVFP4預訓練:首個採用NVFP4量化預訓練的Nemotron 3系列模型,大多數線性層使用NVFP4用於權重、激活和梯度,部分層(潛在投影、MTP層、QKV/attention投影、嵌入)保持BF16或MXFP8以確保訓練穩定性[7]多Token預測(MTP)層:支援同時預測多個未來詞彙,實現3倍更快推理[2]推理優化:在NVIDIA B200 GPU上使用vLLM和TRT-LLM測試,8k輸入序列和64k輸出序列長度下,吞吐量相比Qwen3.5-122B提升7.5倍[6]張量並行配置:支援張量並行大小2或4,最大模型長度65,536,最大批處理token 32,768,使用FLASH_ATTN注意力後端[1]

🔮 前景展望AI analysis grounded in cited sources

Nemotron 3 Omni 的存在無法驗證
搜索結果中完全未發現任何官方NVIDIA公告、新聞稿或技術文檔提及Nemotron 3 Omni,該產品名稱僅存在於Reddit推測中。
Nemotron 3 Super 將主導企業級代理AI市場
該模型在效率、推理能力和吞吐量上相比競爭對手具有顯著優勢,已獲得Perplexity等主要合作夥伴支持,定位於複雜多代理工作流自動化。
NVFP4精度將成為AI推理的新標準
Nemotron 3 Super在NVIDIA Blackwell上使用NVFP4實現4倍推理加速且無精度損失,預示該精度格式將在下一代GPU平台上廣泛採用。

時間線

2025-12
NVIDIA發布Nemotron 3 Nano模型
2026-03-11
NVIDIA正式發布Nemotron 3 Super,採用混合Mamba-Transformer MoE架構,120B參數/12B活躍
2026-03-17
Nemotron 3 Super在Artificial Analysis排行榜中位居開源模型效率首位,Perplexity成為首個合作夥伴
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。