🔬
ROC-AUC 還是 F1?選擇正確評估指標
這篇討論詢問在評估分類模型時,應該何時使用 ROC-AUC,何時使用 F1 分數。選擇取決於類別不平衡、是否需要設定分類閾值,以及更重視排序能力還是精確率與召回率的平衡。
Tag: #model-evaluation95 results
這篇討論詢問在評估分類模型時,應該何時使用 ROC-AUC,何時使用 F1 分數。選擇取決於類別不平衡、是否需要設定分類閾值,以及更重視排序能力還是精確率與召回率的平衡。
一則 Reddit 貼文聲稱,Artificial Analysis 在 Intelligence Index 4.1.1 版中調整 GDPval 與 T3 Banking 的權重,使 Qwen 3.8 Max 的排名低於 Anthropic 的 Opus。這項說法屬於未經來源獨立驗證的指控。

AI 從業者正在討論 Qwen 與 Gemma 模型在基準測試效能上似乎陷入停滯或「僵局」,這引發了對評估指標有效性的質疑。
Reddit 上的一場討論探討了現有的 Qwen 微調模型是否真的優於基礎模型。使用者對當前社群主導的微調工作之成效提出了質疑。
McNemar's test framework detects post-optimization LLM degradations via per-sample comparisons. Aggregates across benchmarks with controlled false positives. Flags 0.3% drops confidently.