🦙Reddit r/LocalLLaMA•較早收集於 17m
NVIDIA Nemotron-3-Nano-4B GGUF 版發布

#quantized-model#nvidia-llm#local-inferencenvidia-nemotron-3-nano-4bnvidianemotron-3-nano-4bgguf
💡NVIDIA 4B nano LLM GGUF 版:立即在本地高效執行。(32字元)
⚡ 30-Second TL;DR
有什麼變化
NVIDIA Nemotron-3-Nano-4B 以 GGUF 格式提供
為什麼重要
提供高效邊緣部署的開源權重選項,擴大 NVIDIA 緊湊高效 LLM 的使用範圍。
下一步行動
從連結儲存庫下載 GGUF,並在 llama.cpp 中載入進行本地測試。
誰應關注:Developers & AI Engineers
關鍵要點
- •NVIDIA Nemotron-3-Nano-4B 以 GGUF 格式提供
- •優化於標準硬體本地推論
- •r/LocalLLaMA 分享附直接下載連結
- •NVIDIA 4B 參數 nano 模型
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 6 個來源。
🔑 增強重點摘要
- •Nemotron-3-Nano 採用混合 Mamba-2 與 Transformer MoE 架構,包含 23 個 Mamba-2 層、23 個 MoE 層和 6 個注意力層,總計 52 層,實現 3.2B 活躍參數(含嵌入層 3.6B)與 30B 總參數的高效率設計[1][4]
- •在單個 H200 GPU 上進行 8K 輸入/16K 輸出設置時,Nemotron-3-Nano 的推論吞吐量比 Qwen3-30B-A3B 高 3.3 倍,比 GPT-OSS-20B 高 2.2 倍[2][4]
- •GGUF 量化版本(4 位元)可在消費級硬體(如 RTX 4090)的 24GB VRAM 限制內運行,而 MXFP4 量化版本可在單個 80GB GPU(A100 或 H100)上部署,保留顯著的 VRAM 空間用於長上下文 KV 快取[3][5]
- •模型支援最多 100 萬個 token 的上下文長度,在 RULER 基準測試中超越 GPT-OSS-20B 和 Qwen3-30B-A3B-Instruct-2507[2]
- •NVIDIA 開放發布模型權重、訓練配方和所有可重新分發的訓練數據,包括超過 3 兆個新的獨特 token,並支援英文、西班牙文、法文、德文、日文和義大利文[1][2][4]
📊 競品分析▸ Show
| 特性 | Nemotron-3-Nano | Qwen3-30B-A3B | GPT-OSS-20B |
|---|---|---|---|
| 總參數 | 30B | 30B | 20B |
| 活躍參數 | 3.2B | 未公開 | 未公開 |
| 架構 | 混合 Mamba-2 Transformer MoE | Transformer | Transformer |
| 推論吞吐量(8K/16K) | 基準 | 0.3 倍 | 0.45 倍 |
| 最大上下文長度 | 100 萬 token | 未公開 | 128K token |
| 量化支援 | GGUF、MXFP4、NVFP4 | 未公開 | 未公開 |
| 消費級 GPU 相容性(24GB) | 是(4 位元 GGUF) | 未確認 | 未確認 |
🛠️ 技術深入
架構設計
- 混合 Mamba-2 Transformer MoE:23 個 Mamba-2 層、23 個 MoE 層、6 個分組查詢注意力(GQA)層,共 52 層[1][4]
- 每個 MoE 層包含 128 個路由專家,每個 token 啟動前 6 個專家,加上 2 個在所有 token 上啟動的共享專家[1]
- 總參數:31.6B(包含嵌入層),活躍參數:3.2B(不含嵌入層)或 3.6B(含嵌入層)[4]
量化與優化
- MXFP4(微縮放格式 4 位元)量化:採用 8 位元 E8M0 或 E4M3 標度編碼,相對於 FP16 保留 >99% 準確度[3]
- 4 位元 GGUF 版本:在 24GB VRAM 消費級 GPU 上運行,約 38GB 儲存空間[5][6]
- FP16 部署需要 60-70GB VRAM 僅用於模型權重,而 MXFP4 版本可在 80GB GPU 上部署並保留顯著 VRAM 空間[3]
輸入/輸出規格
推論優化
🔮 前景展望AI analysis grounded in cited sources
消費級本地 AI 推論的民主化加速
4 位元 GGUF 量化版本在 24GB VRAM 消費級 GPU 上的可用性,將使數百萬開發者和研究人員能夠在本地運行企業級模型,無需雲端依賴或高昂成本。
混合 Mamba-Transformer 架構成為業界標準
Nemotron-3-Nano 在保持或超越純 Transformer 模型準確度的同時實現 3.3 倍吞吐量提升,可能促使其他 AI 廠商採用類似的混合架構設計以提高效率。
開源模型與專有模型之間的性能差距縮小
Nemotron-3-Nano 在多個基準測試中超越或匹敵 GPT-OSS-20B 和 Qwen3-30B-A3B,同時 NVIDIA 開放發布權重和訓練數據,可能加速開源 AI 生態系統的發展。
⏳ 時間線
2024-11
Nemotron-3 系列模型首次公開發布,包含 Nano、Super 和 Ultra 變體
2025-01
Nemotron-3-Nano 技術報告發布,詳細說明混合 Mamba-Transformer MoE 架構和 3.3 倍吞吐量優勢
2025-06
GGUF 量化版本(4 位元)發布,支援消費級 GPU(24GB VRAM)本地推論
2026-01
Nemotron-3-Nano 在 r/LocalLLaMA 社群廣泛採用,下載連結和部署指南分享
2026-03
Nemotron-3-Nano-4B GGUF 版本在 Reddit r/LocalLLaMA 社群確認可用,消費級本地推論應用達到高峰
📎 來源 (6)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
