
開源 LLM 僅差專有模型 5 品質分
whatllm.org 2026 年 1 月報告基準測試 94 個 LLM 端點,顯示開源模型品質指數僅落後專有領導者 5 分。頂尖開源如 GLM-4.7(68 QI)和 DeepSeek V3.2 匹敵 Gemini 3 Pro(73 QI)和 GPT-5.2。開源大幅降低成本,如 $0.30/M 對比 $3.50/M,差距從年初的 12 分縮減。
Tag: #benchmarks166 results

whatllm.org 2026 年 1 月報告基準測試 94 個 LLM 端點,顯示開源模型品質指數僅落後專有領導者 5 分。頂尖開源如 GLM-4.7(68 QI)和 DeepSeek V3.2 匹敵 Gemini 3 Pro(73 QI)和 GPT-5.2。開源大幅降低成本,如 $0.30/M 對比 $3.50/M,差距從年初的 12 分縮減。

更新 Qwen3.5-35B-A3B Unsloth 動態量化,在幾乎所有位元達 SOTA,透過 150+ KL 散度基準。發布 9TB 研究文物,包括所有測試配置。修復影響量化上傳者的工具呼叫聊天模板錯誤。

PewDiePie 微調 Qwen2.5-Coder-32B,在編碼基準上超越 ChatGPT 4o。由 u/hedgehog0 於 r/LocalLLaMA 分享,附連結及評論。
社群要求的 Qwen3.5-35B-A3B 實驗證實 KV q8_0 量化提升吞吐量而不損品質。Q4_K_M 仍是最佳表現者,使用 --fit 達 74.7 tok/s。KL 散度顯示 UD-Q4_K_XL 表現明顯較差。
OpenAI 不再使用 SWE-bench Verified 進行評估,因為其污染嚴重且無法準確衡量前沿程式碼進展。他們的分析指出測試缺陷與訓練資料外洩。他們建議改用 SWE-bench Pro。

Intel Core 3 304 處理器的最新跑分結果顯示,其效能足以與搭載 A18 Pro 的 MacBook Neo 抗衡。這顯示 Windows 筆電在效能競爭上可能出現轉機。
隨著 CPU 製造商重新聚焦於性能基準測試,Nvidia 在 AI 領域的統治地位正受到挑戰。這一轉變標誌著處理器市場競爭的加劇,這是由對專業運算的需求所驅動的。
DeepSeek 的 DeepGEMM nv_dev 分支合併了拉取請求 #328,與上游 #316 變更同步。此更新納入 Mega MoE 最佳化及新基準測試,提升效能。

阿里巴巴的快樂馬AI影片模型在四月匿名排行榜上稱霸,但灰測顯示基準性能與實際可用性有落差。專為高量低成本電商內容打造,而非AI電影導向,現定位為商家可靠的內容生產管道。

Nvidia的Gemma-4-26B-A4B-NVFP4 (18.8GB) 在5090 GPU上運行50k上下文,使用80% VRAM。基準測試幾乎匹配全精度:GPQA 79.9%、AIME 90%、MMLU Pro 84.8%。使用者確認可運作。