無審查 Nemotron-3-Super-120B MLX 版
💡無審查 120B 模型達 94% HumanEval – 本地編碼最佳開源權重。(48字元)
⚡ 30-Second TL;DR
有什麼變化
移除拒絕向量的無審查 4-bit MLX 模型
為什麼重要
透過 MLX 在 Apple 矽晶上實現高效無審查推理,在編碼和安全基準上可能媲美封閉模型,適用本地部署。
下一步行動
從 Hugging Face 下載並使用提供的 custom.py 在 MLX Studio 執行。
關鍵要點
- •移除拒絕向量的無審查 4-bit MLX 模型
- •包含自訂 .py 和聊天模板供 MLX Studio 使用
- •基準測試:HarmBench 97%、HumanEval 94%
- •因獨特注意力機制無法使用 FP16 消融
- •q6 和 q8 量化版明天發布
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 6 個來源。
🔑 增強重點摘要
- •NVIDIA Nemotron 3 Super 於 2026 年 3 月 11 日在 GTC 發布,採用混合 Mamba-Transformer 架構,具有 120B 總參數但僅 12B 活躍參數,相比 GPT-OSS-120B 推理吞吐量高 2.2 倍[1][2]。
- •LatentMoE 架構將令牌投影到較小的潛在維度以進行專家路由,改善每位元組的準確度;模型使用 NVFP4 量化訓練,是 Nemotron 3 系列中首個採用此精度的模型[6]。
- •Nemotron 3 Super 在代理任務上表現顯著優於前代版本,SWE-Bench Verified 達 60.47%(相比 GPT-OSS 的 41.90%),並在 1M 令牌上的 RULER 基準達 91.75%[2]。
- •模型支援最高 1M 令牌上下文長度,在 8k 輸入/16k 輸出設定下相比 Qwen3.5-122B 推理吞吐量高 7.5 倍,定位為多代理系統的效率優化方案[1][2]。
📊 競品分析▸ Show
| 特性 | Nemotron 3 Super | GPT-OSS-120B | Qwen3.5-122B |
|---|---|---|---|
| 總參數 | 120B | 120B | 122B |
| 活躍參數 | 12B | 120B | 122B |
| 推理吞吐量相對值 | 基準 | 0.45x | 0.13x |
| MMLU-Pro | 83.73% | 81.00% | 86.70% |
| SWE-Bench Verified | 60.47% | 41.90% | 未公開 |
| 上下文長度 | 1M | 1M | 1M |
| RULER @ 1M | 91.75% | 22.30% | 未公開 |
| 定位 | 效率優化 | 通用 | 科學推理 |
🛠️ 技術深入
• 混合架構:交錯 Mamba-2 和 MoE 層,搭配選擇性注意力層;Mamba 提供線性時間複雜度,MoE 提供稀疏激活容量[4][6] • LatentMoE 機制:令牌投影到潛在維度進行專家路由(top-22 routing),維持 12.7B 活躍參數預算[4] • 多令牌預測(MTP)層:原生支援推測解碼,加速文本生成並改善品質[1][6] • NVFP4 量化:大多數線性層使用 NVFP4 處理權重、激活和梯度;潛在投影、MTP 層、QKV/注意力投影和嵌入層維持 BF16 或 MXFP8 以保證訓練穩定性[6] • 預訓練規模:25 兆令牌預訓練,後續使用監督微調(SFT)和強化學習(RL)[4] • 推理優化:在 NVIDIA B200 GPU 上使用 vLLM 和 TRT-LLM 測量,相比 MXFP4 精度的 GPT-OSS-120B 每 GPU 吞吐量高 11%[3]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
📎 來源 (6)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- research.nvidia.com — Nemotron 3 Super
- llm-stats.com — Nemotron 3 Super Launch
- artificialanalysis.ai — Nvidia Nemotron 3 Super the New Leader in Open Efficient Intelligence
- research.nvidia.com — Nvidia Nemotron 3 Super Technical Report
- blog.kilo.ai — Nvidia Nemotron 3 Super Launch
- Hugging Face — Nvidia Nemotron 3 Super 120b A12b Nvfp4
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。