Search

Tag: #benchmarks166 results

OpenCode 測試自託管 LLM 如 Gemma 4

OpenCode 測試自託管 LLM 如 Gemma 4

基準測試評估 OpenCode 與自託管 LLM 的效能,包括 Qwen 3.5/3.6、Gemma 4 26B、Nemotron 3 和 GLM-4.7,在 RTX 4080 上執行 Golang CLI 建立和網站遷移對映等任務。Qwen 3.5 27B 和 Gemma 4 表現優異,可比擬雲端 LLM,並提供速度比較。

Reddit r/LocalLLaMACommunityApr 6#benchmarks#self-hosted#coding-tools
⚙️

M5 Max 128GB LLM 基準測試 v2

Apple M5 Max 128GB 的後續基準測試顯示優異提示處理速度,特別是 MoE 模型如 Qwen3.5-35B-A3B 達 2,845 tok/s。Token 生成排名強調 MoE 優於密集模型。測試使用 llama-bench 並比較 llama.cpp 與 MLX。

Reddit r/LocalLLaMACommunityMar 22#benchmarks#moe#apple-silicon
健康AI基準有效性差距揭露

健康AI基準有效性差距揭露

研究人員分析六個基準中18,707個消費者健康查詢,揭露與臨床需求不符的「有效性差距」。基準缺乏複雜診斷如實驗室值(5.2%)和影像(3.8%)、安全關鍵情境(<0.7%),以及弱勢族群代表性(<11%)。他們呼籲採用類似臨床試驗的標準化查詢剖析。

ArXiv AIResearchMar 21#health-ai#benchmarks#evaluation
Page 12 of 17