Search

Tag: #agent-evaluation34 results

RubricForge 降低代理評估中的誤判通過

RubricForge 降低代理評估中的誤判通過

RubricForge 從少量具備真實結果標註的代理軌跡中,自動生成可讀的人類評分規範,之後可在不存取環境的情況下套用固定規範。在 tau-bench 與 WebShop 上,它大幅降低失敗軌跡被誤判為通過的比例,並改善分級結果排序;但整體一致性並未顯著優於 G-Eval。

Page 1 of 4