🦙Reddit r/LocalLLaMA•最新收集於 6h
lm-eval-ledger 讓模型基準答案可直接瀏覽

#benchmarking#evaluation#model-observability#sqlitelm-eval-ledgerlm-eval-ledgerqwen3.5-9bnemotron-3.5-lightning-30b-a3bgemma-4-12b-ithugging face
💡超越基準平均分數,直接查看每個模型在哪些題目成功、失敗或浪費時間。
⚡ 30-Second TL;DR
有什麼變化
網頁應用程式可讓使用者逐題比較不同模型的回答。
為什麼重要
這項工具透過揭示總分背後的失敗模式,可讓基準除錯與模型選擇更加透明。對同時評估推理品質、延遲與回答可靠性的團隊而言尤其實用。
下一步行動
安裝 lm-eval-ledger,在 bench.yaml 設定兩個模型與一項任務,並先於 localhost:8090 檢視逐題失敗案例,再採信彙總分數。
誰應關注:Researchers & Academics
關鍵要點
- •網頁應用程式可讓使用者逐題比較不同模型的回答。
- •記錄欄位包括 system prompt、生成內容、擷取答案、標準答案、停止原因與字元數。
- •基準層級檢視包含準確率、每秒 token 數、完成時間、樣本數與無答案數。
- •工具支援成對比較,以及找出每次都答對或答錯的題目。
- •以 YAML 驅動的工作流程可透過單一指令執行多個模型與任務。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
