☁️較早收集於 12m

Nemotron 3 Nano 在 Bedrock 上無伺服器推出

Nemotron 3 Nano 在 Bedrock 上無伺服器推出
PostLinkedIn
☁️閱讀原文: AWS Machine Learning Blog
#serverless#managed-ai#generative-ainvidia-nemotron-3-nanonvidianemotron-3-nanoamazon-bedrockaws

💡Bedrock 上無伺服器 Nemotron 3 Nano:無需基礎設施即可即時存取 NVIDIA LLM(32字元)

⚡ 30-Second TL;DR

有什麼變化

Nemotron 3 Nano 現已在 Amazon Bedrock 上全託管且無伺服器

為什麼重要

讓 AI 從業人員無需管理基礎設施即可存取先進的 NVIDIA LLM,加速 AWS 上的原型製作與生產部署。以無伺服器推論大幅降低成本與複雜度。

下一步行動

登入 Amazon Bedrock 主控台,並呼叫 Nemotron 3 Nano 進行下一個生成式 AI 實驗。

誰應關注:Developers & AI Engineers

關鍵要點

  • Nemotron 3 Nano 現已在 Amazon Bedrock 上全託管且無伺服器
  • 延續 Nemotron 2 Nano 9B 和 VL 12B 的可用性
  • 詳述技術特性與生成式 AI 應用案例
  • 提供在 Bedrock 中部署的逐步指導

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • Nemotron 3 Nano 採用混合 Mamba-Transformer MoE 架構,包含 23 層 Mamba-2 和 23 層 MoE 層,每層 MoE 有 128 個路由專家加 1 個共享專家,每次處理激活 6 個專家。[1][2][3]
  • 模型總參數 31.6B,激活參數僅 3.2B(含嵌入 3.6B),支援高達 1M 令牌上下文長度,並在 8K 輸入/16K 輸出設定下提供比 Qwen3-30B-A3B-Thinking-2507 高 3.3 倍的推理吞吐量。[1][2][3][6]
  • 於 2025 年 12 月 14 日發布,知識截止至 2025 年 10 月,使用超過 3 兆新獨特令牌訓練,並透過監督微調和大規模 RL 優化,超越前代 Nemotron 2 Nano 的準確度。[1][3]
📊 競品分析▸ Show
特徵Nemotron 3 NanoGPT-OSS-20BQwen3-30B-A3B-Thinking-2507
總/激活參數31.6B / 3.2B未指定未指定
基準準確度優於或相當較低較低
8K/16K 吞吐量基準2.2x 較慢3.3x 較慢
上下文長度1M128K支援 1M

🛠️ 技術深入

  • 架構細節:52 層,包括 23 層 Mamba-2(高效序列處理與長上下文)、23 層 MoE(每層 128 路由專家 + 1 共享專家,激活 6 個/令牌)、6 層注意力層;隱藏維度 2688、32 注意力頭、2 KV 頭、ReLU2 激活、RMS 正規化、絕對位置嵌入。[1][5]
  • 參數與效率:總 31.6B 參數,激活 3.2B(含嵌入 3.6B);FP16 VRAM ~62GB (1k 上下文),支援 FP8/INT4/INT8 量化,1M 上下文需注意記憶體擴展(RTX 4090 可跑但全長易崩潰)。[1][3]
  • 訓練與能力:超過 3 兆新令牌訓練 + SFT + RL;支援多語言(英、西、法、德、日、義);輸入/輸出最大 128K 令牌,優化於 NVIDIA GPU(如 DGX Spark、H100、B200)。[1][3][5][6]

🔮 前景展望AI analysis grounded in cited sources

Nemotron 3 Nano 將加速邊緣與雲端代理式 AI 應用開發
其 1M 上下文與高吞吐量允許處理大型程式碼庫、長文件與多階段計劃,無需片段化策略,提升代理可靠性。[2][6]
NVIDIA Nemotron 3 系列將挑戰 Transformer 主導地位
混合 Mamba-MoE 架構提供優於標準 Transformer 的吞吐量與相當準確度,Super 與 Ultra 將引入 Latent MoE 與 MTP 進一步提升。[2]
Bedrock 整合將擴大 Nemotron 模型的企業採用率
無伺服器託管簡化部署,結合 AWS 生態與 NVIDIA 硬體優化,利於生成式 AI 應用如推理與對話。[8]

時間線

2024-12
在 AWS re:Invent 宣布 Nemotron 2 Nano 9B 與 VL 12B 支援
2025-12
Nemotron 3 Nano 30B-A3B 正式發布
2025-12
NVIDIA 推出 Nemotron 3 系列,Nano 為首款開放模型
2026-01
支援 vLLM 加速推理與 BF16/FP8 精度
2026-03
Nemotron 3 Nano 在 Amazon Bedrock 上無伺服器推出
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。