🦙較早收集於 17m

NVIDIA Nemotron-3-Nano-4B GGUF 版發布

NVIDIA Nemotron-3-Nano-4B GGUF 版發布
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#quantized-model#nvidia-llm#local-inferencenvidia-nemotron-3-nano-4bnvidianemotron-3-nano-4bgguf

💡NVIDIA 4B nano LLM GGUF 版:立即在本地高效執行。(32字元)

⚡ 30-Second TL;DR

有什麼變化

NVIDIA Nemotron-3-Nano-4B 以 GGUF 格式提供

為什麼重要

提供高效邊緣部署的開源權重選項,擴大 NVIDIA 緊湊高效 LLM 的使用範圍。

下一步行動

從連結儲存庫下載 GGUF,並在 llama.cpp 中載入進行本地測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • NVIDIA Nemotron-3-Nano-4B 以 GGUF 格式提供
  • 優化於標準硬體本地推論
  • r/LocalLLaMA 分享附直接下載連結
  • NVIDIA 4B 參數 nano 模型

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • Nemotron-3-Nano 採用混合 Mamba-2 與 Transformer MoE 架構,包含 23 個 Mamba-2 層、23 個 MoE 層和 6 個注意力層,總計 52 層,實現 3.2B 活躍參數(含嵌入層 3.6B)與 30B 總參數的高效率設計[1][4]
  • 在單個 H200 GPU 上進行 8K 輸入/16K 輸出設置時,Nemotron-3-Nano 的推論吞吐量比 Qwen3-30B-A3B 高 3.3 倍,比 GPT-OSS-20B 高 2.2 倍[2][4]
  • GGUF 量化版本(4 位元)可在消費級硬體(如 RTX 4090)的 24GB VRAM 限制內運行,而 MXFP4 量化版本可在單個 80GB GPU(A100 或 H100)上部署,保留顯著的 VRAM 空間用於長上下文 KV 快取[3][5]
  • 模型支援最多 100 萬個 token 的上下文長度,在 RULER 基準測試中超越 GPT-OSS-20B 和 Qwen3-30B-A3B-Instruct-2507[2]
  • NVIDIA 開放發布模型權重、訓練配方和所有可重新分發的訓練數據,包括超過 3 兆個新的獨特 token,並支援英文、西班牙文、法文、德文、日文和義大利文[1][2][4]
📊 競品分析▸ Show
特性Nemotron-3-NanoQwen3-30B-A3BGPT-OSS-20B
總參數30B30B20B
活躍參數3.2B未公開未公開
架構混合 Mamba-2 Transformer MoETransformerTransformer
推論吞吐量(8K/16K)基準0.3 倍0.45 倍
最大上下文長度100 萬 token未公開128K token
量化支援GGUF、MXFP4、NVFP4未公開未公開
消費級 GPU 相容性(24GB)是(4 位元 GGUF)未確認未確認

🛠️ 技術深入

架構設計

  • 混合 Mamba-2 Transformer MoE:23 個 Mamba-2 層、23 個 MoE 層、6 個分組查詢注意力(GQA)層,共 52 層[1][4]
  • 每個 MoE 層包含 128 個路由專家,每個 token 啟動前 6 個專家,加上 2 個在所有 token 上啟動的共享專家[1]
  • 總參數:31.6B(包含嵌入層),活躍參數:3.2B(不含嵌入層)或 3.6B(含嵌入層)[4]

量化與優化

  • MXFP4(微縮放格式 4 位元)量化:採用 8 位元 E8M0 或 E4M3 標度編碼,相對於 FP16 保留 >99% 準確度[3]
  • 4 位元 GGUF 版本:在 24GB VRAM 消費級 GPU 上運行,約 38GB 儲存空間[5][6]
  • FP16 部署需要 60-70GB VRAM 僅用於模型權重,而 MXFP4 版本可在 80GB GPU 上部署並保留顯著 VRAM 空間[3]

輸入/輸出規格

  • 最大輸入大小:128K token[1]
  • 最大輸出大小:128K token[1]
  • 上下文長度支援:最多 100 萬 token[2]
  • 支援語言:英文、西班牙文、法文、德文、日文、義大利文[1]

推論優化

  • 針對 NVIDIA GPU 加速系統優化,利用 CUDA 庫和 TensorRT-LLM 框架[1]
  • 支援 llama.cpp、vLLM 和 TensorRT-LLM 等優化執行時環境[3][5]
  • 內建推理(思考模式)和工具呼叫支援[5]

🔮 前景展望AI analysis grounded in cited sources

消費級本地 AI 推論的民主化加速
4 位元 GGUF 量化版本在 24GB VRAM 消費級 GPU 上的可用性,將使數百萬開發者和研究人員能夠在本地運行企業級模型,無需雲端依賴或高昂成本。
混合 Mamba-Transformer 架構成為業界標準
Nemotron-3-Nano 在保持或超越純 Transformer 模型準確度的同時實現 3.3 倍吞吐量提升,可能促使其他 AI 廠商採用類似的混合架構設計以提高效率。
開源模型與專有模型之間的性能差距縮小
Nemotron-3-Nano 在多個基準測試中超越或匹敵 GPT-OSS-20B 和 Qwen3-30B-A3B,同時 NVIDIA 開放發布權重和訓練數據,可能加速開源 AI 生態系統的發展。

時間線

2024-11
Nemotron-3 系列模型首次公開發布,包含 Nano、Super 和 Ultra 變體
2025-01
Nemotron-3-Nano 技術報告發布,詳細說明混合 Mamba-Transformer MoE 架構和 3.3 倍吞吐量優勢
2025-06
GGUF 量化版本(4 位元)發布,支援消費級 GPU(24GB VRAM)本地推論
2026-01
Nemotron-3-Nano 在 r/LocalLLaMA 社群廣泛採用,下載連結和部署指南分享
2026-03
Nemotron-3-Nano-4B GGUF 版本在 Reddit r/LocalLLaMA 社群確認可用,消費級本地推論應用達到高峰
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。