🦙較早收集於 3h

Nvidia 移除 Nemotron 許可中的 rug-pull 條款

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#license-change#model-freedom#guardrailsnemotron-super-3-122b-a12bnvidianemotron-super-3-122b-a12blocal-llama

💡Nemotron 許可現允許移除護欄無終止風險—微調重大利好。(38字元)

⚡ 30-Second TL;DR

有什麼變化

移除護欄繞過終止條款

為什麼重要

運營者可無懼許可終止風險修改模型,提升開源 LLM 實驗。這可能加速社群微調和無審查變體。Nemotron 模型採用率預計上升。

下一步行動

下載 BF16 Nemotron 變體並驗證新許可通知。

誰應關注:Developers & AI Engineers

關鍵要點

  • 移除護欄繞過終止條款
  • 簡化品牌為標準通知檔案
  • 消除特殊用途模型限制
  • 不再需要 NVIDIA Cosmos 品牌
  • BF16、FP8、NVFP4 變體有 Git 日誌

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • Nemotron 3 Super 採用混合 Mamba2-Transformer Latent MoE 架構,總參數 120B 但推理時僅啟用 12B 參數,提升效率。
  • 模型支援 NVFP4 原生預訓練,在 NVIDIA Blackwell 上比 FP8 在 H100 上快 4 倍,記憶體需求大幅降低。
  • 透過 21 個強化學習環境訓練,超過 120 萬次 rollout,在 PinchBench 基準測試中得分 85.6%,為同級最佳開源模型。
  • 發布包含超過 10 兆 token 訓練資料、完整配方及 GitHub 資源,可在 Hugging Face、NVIDIA NIM 等多平台部署。

🛠️ 技術深入

  • 架構細節:Mamba2-Transformer 混合 Latent Mixture of Experts (LatentMoE),結合 Multi-Token Prediction (MTP),Mamba 層提供 4 倍記憶體與運算效率,Transformer 層負責精準推理。
  • 參數配置:總 120B 參數,推理激活 12B;支援 NVFP4、BF16、FP8 變體。
  • 訓練資料:預訓練截止 2025 年 6 月,後訓練至 2026 年 2 月,使用合成資料超過 10 兆 token,21 個 RL 環境。
  • 硬體支援:NVIDIA Ampere (A100)、Hopper (H100-80GB)、Blackwell;運行於 NeMo 25.11.01,Linux OS。
  • 推理優化:reasoning mode 可經 chat template 切換 (enable_thinking=True/False),建議 temperature=1.0, top_p=0.95。

🔮 前景展望AI analysis grounded in cited sources

企業多代理系統部署成本將降低 5 倍以上
MoE 架構僅激活 12B 參數,結合 Mamba 效率與 NVFP4 優化,大幅減少 token 處理與硬體需求。
開源社群將加速 agentic AI 應用開發
寬鬆許可加上完整訓練配方與資料發布,讓開發者自由微調並整合至 OpenClaw 等框架。
NVIDIA Blackwell 硬體採用率將顯著提升
NVFP4 原生優化提供 4 倍推理加速,吸引企業自部署高階模型。

時間線

2025-12
Nemotron 3 Nano 發布,奠定系列基礎
2025-12-15
NVIDIA Nemotron Open Model License 首次發布
2026-03-11
Nemotron 3 Super 120B 正式發布於 Hugging Face
2026-03-15
許可更新移除 rug-pull 條款,社群廣泛討論
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。