Qwen 3 32B 盲測勝所有 Qwen 3.5
Qwen 3 32B 在 11 項盲測中以 9.63 平均分勝過所有 Qwen 3.5 模型。高效 3B 活躍參數的 Qwen 3.5 35B-A3B 贏得 4 項評測,適合本地硬體。Coder Next 落後通用模型。
Tag: #benchmarks166 results
Qwen 3 32B 在 11 項盲測中以 9.63 平均分勝過所有 Qwen 3.5 模型。高效 3B 活躍參數的 Qwen 3.5 35B-A3B 贏得 4 項評測,適合本地硬體。Coder Next 落後通用模型。

Reddit 用戶在嚴苛自訂基準測試中檢驗新 Nemotron 3 4B Q8,包括數學證明、模運算求和及 JSON 結構化輸出。Qwen 3.5 4B 完美通過所有任務,而 Nemotron 儘管承諾更大上下文,卻嚴重失敗。詳細提示與失敗案例凸顯推理缺陷。
基準測試比較 Hugging Face 上 Qwen3.5-35B GGUF 量化版本(16-22 GiB)的 KLD 差異和速度。使用多語言 FLORES 200 和校準資料集。表格依 KLD 平均值和 99% 排名,在 RTX 3090 上 TG/s 最高達 143。

研究人員評估 6 款資料分析代理,發現其在處理有狀態與事件特定時序查詢時存在缺口。他們推出 AgentFuel,協助領域專家快速建立客製化、具表現力的端到端評估基準。基準資料集已在 Hugging Face 上提供。

洩漏基準測試顯示蘋果 M5 Max MacBook Pro 單核(4,268)與多核(29,233)分數創紀錄,超越所有消費級 PC,適合 AI 與專業任務。預算版 MacBook Neo 分數 3,461/8,668,優於 M1 Air。所有型號支援 Apple Intelligence。

Artificial Analysis 發布本地友好模型排行榜,按推理/非推理及大小分類。最高分包括 Solar Open 100B 達 22 分,Llama Nemotron Super 49B v1.5 達 19 分。Gemma 3 12B (12 分) 超越 27B (10 分) 的驚人結果。

Qwen3.5 0.8B/2B/4B/9B 少樣本基準顯示 0.8B 程式碼修復零樣本 67% 加例降至 33%。分類 8 樣本達 100%;4B 全任務穩定。結論推崇 4B 為最佳點。

Reddit 使用者將官方 Qwen3.5 與 Qwen3 基準分數平均後視覺化。新模型(紫/藍)通常優於舊模型(橙/黃)。原始資料可在 Google Sheet 查看;小型模型部分資料缺失。

作者提出「體檢報告」式AI模型評測:結論前置、可重現快照、可執行評分、關鍵指標及典型案例,加速上線或修復決策。將基準視為資產,防洩漏維護並壞案例回歸。轉化評測為團隊系統加速迭代。
Google Cloud AI 在三個關鍵 AI 模型前沿領先:原始智能、回應時間和可擴展性。此領導地位使其在推進模型能力方面處於前列。分析強調這些維度的同時進展。