Search

Tag: #benchmarks166 results

Qwen3 對 Qwen3.5 效能對比

Qwen3 對 Qwen3.5 效能對比

Reddit 分享 Qwen3 與 Qwen3.5 模型效能比較。密集模型使用列出參數大小;MoE 模型透過 sqrt(總數 × 活躍) 縮放以近似計算等效。資料來自 artificialanalysis.ai 排行榜。

Reddit r/LocalLLaMACommunityMar 5#benchmarks#moe-models
Qwen3/3.5 成本效能權衡圖表

Qwen3/3.5 成本效能權衡圖表

散點圖分析 Qwen3、Qwen3.5 及其他模型的混合權重(3:1 輸入/輸出)每百萬 token 美元價格,對比 Artificial Analysis 智慧指數與 LM Arena 分數。API 成本作為運算需求代理,以對數刻度呈現權衡。呼籲納入小型模型至基準測試。

Reddit r/LocalLLaMACommunityMar 3#benchmarks#pricing-analysis#compute-costs
Qwen3.5-27B 領先家族基準測試

Qwen3.5-27B 領先家族基準測試

ArtificialAnalysis.ai 在智慧指數、程式設計指數與代理指數上,將 Qwen3.5-27B 評為高於 Qwen3.5-122B-A10B 與 Qwen3.5-35B-A3B。小型模型在所有類別勝過更大 MoE 兄弟模型。

Reddit r/LocalLLaMACommunityFeb 26#benchmarks#moe#qwen
Wizwand V2 修正資料集比較

Wizwand V2 修正資料集比較

Wizwand V2 改進其 PaperWithCode 替代品,使用 LLM 進行自然語言資料集描述,解決如 val 對 test 分割的不一致問題。它簡化任務粒度,使用領域/任務標籤,移除脆弱分類法以實現更公平基準。邀請使用者在 wizwand.com 測試。

Reddit r/MachineLearningCommunityFeb 19#benchmarks#dataset-matching#task-granularity
Page 16 of 17