
Nemotron-3-Nano 主宰 4B 模型基準測試
在 M3 Pro 上基準測試 2026 年 4B 模型:NVIDIA Nemotron-3-Nano-4B 以 85% 總分領先(財經 100%),微軟 Phi4-mini 以 77% 次之。揭示實驗室專精,如 IBM Granite 的程式碼強項對比 Nemotron 的推理;Qwen3.5-4B 因思考模式令牌預算問題僅 15%。
Tag: #benchmarks166 results

在 M3 Pro 上基準測試 2026 年 4B 模型:NVIDIA Nemotron-3-Nano-4B 以 85% 總分領先(財經 100%),微軟 Phi4-mini 以 77% 次之。揭示實驗室專精,如 IBM Granite 的程式碼強項對比 Nemotron 的推理;Qwen3.5-4B 因思考模式令牌預算問題僅 15%。
使用者在 5090 筆電(24GB VRAM)測試 Qwen 3.6 27B,通過工具呼叫及 pyspark/python 資料科學基準。計畫取消雲端訂閱。在 llama.cpp q4 量化下高效運行。

Qwen 3.6-27B 密集模型整體領先 35B-A3B MoE,但 MoE 在 10 基準中 7 項縮小差距。MoE 在編碼表現出色,如 SWE-bench 領先縮減。密集模型在 Terminal-Bench 異常領先。
SanityHarness 評估測試 Kimi K2.6-Code-Preview、Opus 4.7、GLM 5.1、Minimax M2.7 的程式碼任務,共 145 結果。Opus 4.7 展現真實進步;GLM 5.1 等開源權重具競爭力但落後頂級封閉模型。ForgeCode 代理強但 UX 多 bug。

Spatial Atlas 引入計算基礎推理 (CGR),在語言模型生成前透過確定性計算解決子問題。它處理 FieldWorkArena 的多模態空間問答及 MLE-Bench 的機器學習競賽,使用場景圖與模型路由。在基準上實現競爭性準確率並具高度可解釋性。

Anthropic 的 Mythos 刷新 AI 大模型紀錄但未開放。Claude Opus 4.6 作為目前最強程式模型,卻答不出走路洗車、紅綠色盲等簡單問題。高價付費用戶包括 AMD AI 高管表示嚴重影響開發。

Anthropic 為 Claude AI 代理的 skill-creator 工具新增評估與基準測試功能。技能創作者無需撰寫程式碼,即可驗證技能運作並測量品質。此舉旨在防止 AI 代理技能品質下降。

貼文回顧一年前「Local o3」提問,如今 Gemma 4 31B 對 OpenAI o3 基準測試成真。歸功 r/LocalLLaMA 社群推動本地 AI 快速進展。包含比較圖片顯示進步。
新開源記憶工具 MemPalace 爆紅,宣稱 LoCoMo 100% 及 LongMemEval 完美,獲 7k GitHub 星。其 BENCHMARKS.md 揭露 LoCoMo 用 top_k=50 繞過檢索;LongMemEval 僅 recall@5,非完整 QA。真實分數 60-89%。

Gemma 4 在丹麥語、荷蘭語、法語和義大利語等歐洲語言中展現巨大進步。31B 模型排名優異:在芬蘭語第 1、丹麥語第 2、法語第 2 和義大利語第 2,其他語言也名列前茅。來自 euroeval.com 的基準測試顯示小型模型表現強勁。