🦞較早收集於 0m

Nemotron-3-Super 主宰 OpenClaw 基準測試

Nemotron-3-Super 主宰 OpenClaw 基準測試
PostLinkedIn
🦞閱讀原文: OpenClaw.report

💡了解 Nemotron-3-Super 如何透過效率而非規模主宰代理基準測試(42字)

⚡ 30-Second TL;DR

有什麼變化

總 120B 參數,每 token 僅啟用 12.7B

為什麼重要

證明高效稀疏模型在代理基準測試中脫穎而出,可能降低機器人 AI 應用的計算成本。標誌代理開發轉向一致性導向評估。

下一步行動

在 PinchBench 上測試 Nemotron-3-Super 以基準你的 OpenClaw 代理一致性。

誰應關注:Researchers & Academics

關鍵要點

  • 總 120B 參數,每 token 僅啟用 12.7B
  • 領導 OpenClaw 代理的 PinchBench 平均排行榜
  • 強調機器人一致性而非原始模型智能

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 4 個來源。

🔑 增強重點摘要

  • Nemotron-3-Super 採用混合 Mamba-Transformer MoE 架構,結合 LatentMoE 技術提升準確性,並支援高達 1M token 上下文長度。
  • 模型在 Terminal-Bench Hard 上得分 29%,在 GDPval-AA 代理基準上 ELO 達 1027,並在 DeepResearch Bench 排行榜上位居第一。
  • 相較 GPT-OSS-120B 和 Qwen3.5-122B,Nemotron-3-Super 在 8k 輸入/16k 輸出設定下推論吞吐量分別高 2.2 倍和 7.5 倍。
  • 提供多種檢查點,包括 NVFP4、FP8 和 BF16 量化版本,並開源訓練資料集。
📊 競品分析▸ Show
模型總參數/活躍參數關鍵基準推論吞吐量優勢
Nemotron-3-Super120B/12BTerminal-Bench Hard: 29%, GDPval-AA ELO: 1027, DeepResearch #1比 GPT-OSS-120B 高 2.2x, 比 Qwen3.5-122B 高 7.5x
GPT-OSS-120B120B較低準確性基準
Qwen3.5-122B122B較低準確性基準

🛠️ 技術深入

  • 架構細節:混合 Mamba-Attention MoE,總參數 120.6B,每前向傳遞活躍 12.7B(排除嵌入 12.1B),包含 LatentMoE(啟用 4 個專家以單一成本提升準確性)、Multi-Token Prediction (MTP) 支援推測解碼加速 3x 推論。
  • 訓練:25 兆 token 預訓練(NVFP4 低精度)、後訓練含 SFT 和 RLHF,使用 GenRM 模型。
  • 推論配置:最大上下文 1M token,支援 NVFP4 精度(Blackwell 平台比 Hopper FP8 快 4x),FlashAttention、FlashInfer MoE 後端,編譯器優化如 fuse_allreduce_rms。
  • 硬體規格:Tensor Parallel Size 2,最大模型長度 65,536,GPU 記憶體利用 90%,最大批次 token 32,768。

🔮 前景展望AI analysis grounded in cited sources

Nemotron-3-Super 將加速開源代理 AI 在企業部署
其高吞吐量、1M 上下文及工具呼叫能力適合自主代理系統,降低高風險環境錯誤。
混合 MoE 架構將成為大型模型效率標準
LatentMoE 和 MTP 證明在維持準確性的前提下大幅提升 FLOP 效率,超越傳統 MoE。
NVFP4 預訓練將推廣低精度訓練
證實 NVFP4 在 25 兆 token 規模下穩定,無準確性損失,適用 Blackwell 等新硬體。

時間線

2026-03
NVIDIA 發佈 Nemotron-3-Super,領導 OpenClaw PinchBench 及多項代理基準
2025-01
Nemotron 3 Nano 發佈,引入類似低精度預訓練技術
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: OpenClaw.report

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。