🦙最新收集於 6h

lm-eval-ledger 讓模型基準答案可直接瀏覽

lm-eval-ledger 讓模型基準答案可直接瀏覽
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#benchmarking#evaluation#model-observability#sqlitelm-eval-ledgerlm-eval-ledgerqwen3.5-9bnemotron-3.5-lightning-30b-a3bgemma-4-12b-ithugging face

💡超越基準平均分數,直接查看每個模型在哪些題目成功、失敗或浪費時間。

⚡ 30-Second TL;DR

有什麼變化

網頁應用程式可讓使用者逐題比較不同模型的回答。

為什麼重要

這項工具透過揭示總分背後的失敗模式,可讓基準除錯與模型選擇更加透明。對同時評估推理品質、延遲與回答可靠性的團隊而言尤其實用。

下一步行動

安裝 lm-eval-ledger,在 bench.yaml 設定兩個模型與一項任務,並先於 localhost:8090 檢視逐題失敗案例,再採信彙總分數。

誰應關注:Researchers & Academics

關鍵要點

  • 網頁應用程式可讓使用者逐題比較不同模型的回答。
  • 記錄欄位包括 system prompt、生成內容、擷取答案、標準答案、停止原因與字元數。
  • 基準層級檢視包含準確率、每秒 token 數、完成時間、樣本數與無答案數。
  • 工具支援成對比較,以及找出每次都答對或答錯的題目。
  • 以 YAML 驅動的工作流程可透過單一指令執行多個模型與任務。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。