
AI評估需要項目級基準數據
這篇立場論文主張,項目級基準數據對AI評估科學至關重要,能解決當前範式的系統性有效性失敗。論文借鑑心理測量學與電腦科學,倡導細粒度診斷。OpenEval 被引入作為支持證據中心AI評估的儲存庫。
Tag: #benchmarks166 results

這篇立場論文主張,項目級基準數據對AI評估科學至關重要,能解決當前範式的系統性有效性失敗。論文借鑑心理測量學與電腦科學,倡導細粒度診斷。OpenEval 被引入作為支持證據中心AI評估的儲存庫。

使用 4chan 數據訓練 8B 與 70B 模型優於基模型,為罕見微調成功。模型卡片詳述基準測試結果。提供 Reddit 討論與 HF 儲存庫連結。

OpenAI 正在 LM Arena 和 ChatGPT 上低調測試新一代 Image V2 模型。早期測試者指出提示準確性強且 UI 渲染逼真。這顯示影像生成能力的進展。

基準測試評估 OpenCode 與自託管 LLM 的效能,包括 Qwen 3.5/3.6、Gemma 4 26B、Nemotron 3 和 GLM-4.7,在 RTX 4080 上執行 Golang CLI 建立和網站遷移對映等任務。Qwen 3.5 27B 和 Gemma 4 表現優異,可比擬雲端 LLM,並提供速度比較。
基準測試 Google 新 Gemma4 對 Alibaba 的 Qwen3.5,在 RTX 4090 上進行本地代理編碼。Qwen3.5-27B 在程式碼品質、可靠性和效率上表現出色,儘管速度較慢。MoE 變體如 Gemma4-26B 較快但複雜任務準確度較低。

用戶測試 Gemini 3 Pro Deepthink 解無解的安全悖論謎題,得到華麗但有瑕疵的解答。Gemma 4 31B 徹底拆解,發現物理違規與假數學。反饋後,Gemini 承認邏輯失效。
Gemma 4 2B 在舊 RTX 2060 6GB 上優於 Qwen3.5 2B:更快、更低記憶體、更具代理性,圖表及輸出更好。實際感覺等同 Qwen3.5 9B。
評論指出 AI 記憶系統在 LOCOMO 基準使用不一致評估,官方 Token-Overlap F1 GPT-4 僅 32%,但自訂指標達 60-67%。開發者混用擷取準確率與關鍵字比對,跨系統比較無意義。呼籲標準化方法。
Apple M5 Max 128GB 的後續基準測試顯示優異提示處理速度,特別是 MoE 模型如 Qwen3.5-35B-A3B 達 2,845 tok/s。Token 生成排名強調 MoE 優於密集模型。測試使用 llama-bench 並比較 llama.cpp 與 MLX。

研究人員分析六個基準中18,707個消費者健康查詢,揭露與臨床需求不符的「有效性差距」。基準缺乏複雜診斷如實驗室值(5.2%)和影像(3.8%)、安全關鍵情境(<0.7%),以及弱勢族群代表性(<11%)。他們呼籲採用類似臨床試驗的標準化查詢剖析。