Search

Tag: #benchmarks166 results

Nemotron-3-Nano 主宰 4B 模型基準測試

Nemotron-3-Nano 主宰 4B 模型基準測試

在 M3 Pro 上基準測試 2026 年 4B 模型:NVIDIA Nemotron-3-Nano-4B 以 85% 總分領先(財經 100%),微軟 Phi4-mini 以 77% 次之。揭示實驗室專精,如 IBM Granite 的程式碼強項對比 Nemotron 的推理;Qwen3.5-4B 因思考模式令牌預算問題僅 15%。

Reddit r/LocalLLaMACommunityApr 27#benchmarks#model-specialization
3.6-27B 密集-MoE 差距縮小

3.6-27B 密集-MoE 差距縮小

Qwen 3.6-27B 密集模型整體領先 35B-A3B MoE,但 MoE 在 10 基準中 7 項縮小差距。MoE 在編碼表現出色,如 SWE-bench 領先縮減。密集模型在 Terminal-Bench 異常領先。

Reddit r/LocalLLaMACommunityApr 22#benchmarks#dense-moe#coding
Spatial Atlas:計算基礎空間推理

Spatial Atlas:計算基礎空間推理

Spatial Atlas 引入計算基礎推理 (CGR),在語言模型生成前透過確定性計算解決子問題。它處理 FieldWorkArena 的多模態空間問答及 MLE-Bench 的機器學習競賽,使用場景圖與模型路由。在基準上實現競爭性準確率並具高度可解釋性。

ArXiv AIResearchApr 16#agent#spatial-reasoning#benchmarks
Page 11 of 17