🦙較早收集於 59m

Nemotron 3 Super自身推理循環

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#model-bug#reasoning-loop#llama-cppnemotron-3-supernemotron-3-superllama-serveraider

💡修復Nemotron缺陷:自身推理變無限循環!

⚡ 30-Second TL;DR

有什麼變化

模型將自身推理鏈視為新用戶訊息

為什麼重要

暴露進階推理模型在本地推論的潛在缺陷。可能影響使用Nemotron的代理工作流程可靠性。

下一步行動

在llama-server執行Nemotron 3 Super,無--special旗標隔離推理循環。

誰應關注:Developers & AI Engineers

關鍵要點

  • 模型將自身推理鏈視為新用戶訊息
  • 後端:llama-server旗標--special及--jinja
  • 客戶端:Aider;產生8k token循環元分析
  • 其他模型未見的獨特問題

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • Nemotron 3 Super 支援高達 1M 上下文長度,適合長序列代理任務,但可能放大推理鏈在 llama-server 中的自我引用問題[3][4]
  • 模型在 PinchBench 基準測試中得分 85.6%,成為同類開放模型最佳,顯示強大代理性能但未提及推理循環兼容性[2]
  • 在代碼審查評估中,Nemotron 3 Super 以 12.5 秒內僅 2 次工具呼叫產生有用審查,證明高效代理能力[5]
📊 競品分析▸ Show
模型總參數/活躍參數架構基準表現
Nemotron 3 Super120B/12BHybrid Mamba-Transformer MoETerminal-Bench Hard: 29%, GDPval-AA ELO: 1027, PinchBench: 85.6%[1][2]
GPT-OSS-120B120B未指定推理吞吐量低於 Nemotron 2.2×[3]
Qwen3.5-122B122B未指定推理吞吐量低於 Nemotron 7.5×[3]

🛠️ 技術深入

  • 架構:混合 Mamba-Transformer 主幹,採用 LatentMoE(令牌壓縮至潛在維度路由至專家),總參數 120.6B,活躍參數 12.7B[2][3][4]
  • 多令牌預測 (MTP):單次前向傳遞預測多個未來令牌,提升生成速度並內建推測解碼[2][3][4]
  • NVFP4 預訓練:使用 NVIDIA Blackwell 優化,低精度訓練減少記憶體需求,在 B200 GPU 上比 H100 FP8 快 4×[2][4]
  • 推理配置:最大模型長度 65,536,支援 FLASH_ATTN 後端,編譯器通過 fuse_allreduce_rms 和 eliminate_noops[1]
  • 後訓練:25 兆令牌預訓練 + SFT + 多環境 RL(21 配置,超過 120 萬 rollout)[2][3]

🔮 前景展望AI analysis grounded in cited sources

llama-server 需新增 Nemotron 專屬推理分離旗標
模型內建生成推理軌跡後結尾回應,易被視為新用戶訊息導致循環,類似 --special 但需 --jinja 調整[4]
代理應用將優先採用 Nemotron 3 Super 以提升吞吐量
其 2.2× 至 7.5× 高於競爭對手推理速度及 1M 上下文,適合多代理軟體開發與資安任務[2][3][5]

時間線

2025-12
發布 Nemotron 3 Nano,為 Super 模型家族先驅
2026-03
發布 Nemotron 3 Super,引入 LatentMoE 與 MTP 創新架構
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。