
DeepFact:共同演化基準與代理用於深度研究事實性
DeepFact 提出審計後評分(AtS)方法,創建演化基準,用於驗證搜尋增強 LLM 代理產生的深度研究報告事實性。它推出 DeepFact-Bench,一個具可審計依據的版本化基準,以及 DeepFact-Eval,一個超越現有工具的驗證代理。專家對聲明的準確率經迭代審計從 60.8% 提升至 90.9%。
Tag: #evaluation51 results

DeepFact 提出審計後評分(AtS)方法,創建演化基準,用於驗證搜尋增強 LLM 代理產生的深度研究報告事實性。它推出 DeepFact-Bench,一個具可審計依據的版本化基準,以及 DeepFact-Eval,一個超越現有工具的驗證代理。專家對聲明的準確率經迭代審計從 60.8% 提升至 90.9%。
NVIDIA NeMo 推出 Evaluator Agent Skills,可在數分鐘內進行對話式 LLM 評估。此工具於 Hugging Face Blog 強調,能快速評估 LLM 在對話中的表現。此舉簡化開發者的評估流程。

LangChain 推出 CLI 與首套技能,讓 AI 程式碼代理具備 LangSmith 生態系統專業知識。技能涵蓋代理追蹤、執行理解、測試集建置及效能評估。此更新大幅提升 Claude Code 在評估集上的表現。

LangChain 推出首套技能,讓 AI 程式碼代理精通開源 LangChain 生態系統。技能聚焦使用 LangChain、LangGraph 及 Deep Agents 建置代理。此更新將 Claude Code 在評估集表現從 29% 提升至 95%。
OpenAI 不再使用 SWE-bench Verified 進行評估,因為其污染嚴重且無法準確衡量前沿程式碼進展。他們的分析指出測試缺陷與訓練資料外洩。他們建議改用 SWE-bench Pro。

一項新研究發現,LLM 往往能與人類的道德判斷標籤一致,卻依賴不同的倫理原則與情境假設。研究團隊使用包含 500 個題目的 ETHICS 衍生基準,主張評估真正的對齊程度必須分析模型的推理依據。
一項預先註冊的研究在 10 個模型上評估 29 種模型內部訊號,結果顯示基於幾何的偵測器在大多數留出測試中都優於隨機機率。研究指出,或許存在通用的擬合程序,但目前沒有任何單一偵測器或訊號方向能在所有模型上可靠運作。

本文探討使用「判斷預測任務」(即 AI 預測特定專家對主觀問題的回答)作為基準測試概念推理能力的方法。文中強調了在主觀領域中,相較於客觀基準數據集,判斷預測面臨著雜訊與意見分歧的挑戰。
Hugging Face 推出了 FFASR 排行榜,旨在評估真實世界條件下的自動語音識別 (ASR) 系統。此舉旨在提供超越標準學術數據集的更準確性能評估。
作者認為,STT 分數和延遲等傳統指標無法捕捉多輪對話系統的品質。自動化對話層級 QA 被提議作為識別互動失敗的更有效方法。