Gemma 4 基準測試匹敵 Qwen 3.5
詳細基準測試表格比較 Gemma 4 變體與 Qwen 3.5,在 MMLU-Pro、GPQA、LiveCodeBench 等項目中。Gemma 31B 及 26B MoE 表現競爭力強,常與 Qwen 領先者相差僅 1-2%,涵蓋推理、編碼及數學任務。資料來自官方模型卡。
Tag: #benchmarks166 results
詳細基準測試表格比較 Gemma 4 變體與 Qwen 3.5,在 MMLU-Pro、GPQA、LiveCodeBench 等項目中。Gemma 31B 及 26B MoE 表現競爭力強,常與 Qwen 領先者相差僅 1-2%,涵蓋推理、編碼及數學任務。資料來自官方模型卡。
Gemma 4 (26B MoE 與 31B 密集) 在最大努力提示下高效推理達 10 分鐘破解密碼。不同於短思考,模型避免幻覺答案。提示可匹敵 Qwen3.5 與封閉模型。

ByteShape 發布 Qwen 3.5 9B 量化版本,並跨 5090/4080 等 GPU 及 CPU 基準測試。GPU 關鍵選擇:5.10 bpw 基準、4.43 bpw 平衡、3.60 bpw 快速。部落格提供互動圖表供硬體特定選擇;首波 Qwen 發布,後續更多。

阿里巴巴在 Reddit r/LocalLLaMA 上發布 Qwen3.5-Omni 的基準測試結果。貼文分享模型效能細節。社群討論可能在留言中展開。
AIfred Intelligence 在審判多代理模式下,對9款模型(80B-235B)進行「狗 vs 貓」辯論基準測試。Qwen3-Next-80B-A3B 僅3B活躍參數,即匹配235B品質且速度快3倍。硬體使用4張GPU共120GB VRAM搭配llama.cpp。

研究人員推出首個多目標搜尋(MOS)全面基準測試套件,以解決評估碎片化問題。套件涵蓋道路網、合成圖形、遊戲格網及機器人運動規劃路徑圖,並提供固定實例與參考Pareto解集。此舉實現從強相關到獨立目標的穩健、可重現比較。

研究人員推出九個目標導向的思考鏈解釋任務,黑盒 LLM 監控在 OOD 表現不佳。他們開源資料集,包含同分布與 OOD 評估,對探針、TF-IDF 及 LLM 監控進行基準測試,非 LLM 方法在 OOD 表現更優。此測試平台用於基準社區進展,超越單純閱讀 CoT。

Intercom 推出 Fin Apex 1.0,這款小型後訓練 AI 模型在客服解析率上勝過 GPT-5.4(73.1% 對 71.1%)及 Claude 模型。它提供更快的 3.7 秒回應、幻覺減少 65%,且成本僅五分之一。此模型擁有數億參數,基於開源權重,驅動 Intercom 的 Fin AI 代理。

KidGym 是多模態大模型的互動 2D 格子基準,受兒童認知測驗啟發,已獲 ICLR 2026 錄取。涵蓋 5 種能力、12 類任務與 3 難度,強調泛化。強模在抽象推理與多規則協調上表現不佳。
Nemotron Cascade 2 30B-A3B 在 HumanEval 達 97.6%,超越 Qwen3.5 中型模型,在 ClassEval 達 88%。它是基於 Nemotron 自家架構的混合模型。IQ4_XS 量化版在本機表現優異。