Search

Tag: #evaluation-metrics7 results

逃脫一致性陷阱:規則治理AI的防禦性信號

逃脫一致性陷阱:規則治理AI的防禦性信號

研究人員提出防禦性指數 (DI) 和歧義指數 (AI) 等新指標,用於評估規則治理的 AI 內容審核,避免人類標籤一致性的「一致性陷阱」。他們引入來自 token logprobs 的機率防禦性信號 (PDS),用於推理穩定性評估。在 193k+ Reddit 決策上驗證,顯示傳統指標的重大差距,並實現 78.6% 自動化覆蓋率。

LLM 網頁代理規劃框架

LLM 網頁代理規劃框架

這篇 arXiv 論文提出用於基於 LLM 的網頁代理的正式 AI 規劃框架,將架構對應到經典搜尋範式如 BFS、DFS。它提出五個新指標評估軌跡品質,以及 794 個 WebArena 人工標註軌跡資料集。結果顯示 Step-by-Step 代理更貼近人類路徑,而 Full-Plan 代理在準確度上出色。