Search

直接匹配不多,已補上最新動態。

Tag: #critic-model1 results

從稀疏真實結果的評分準則監督評論者

從稀疏真實結果的評分準則監督評論者

提出 Critic Rubrics,一種從人類-代理編碼互動軌跡中提取 24 個行為特徵的框架,用以從稀疏真實世界反饋訓練評論者模型。可用於半監督預測評分準則和結果,支持 RL 訓練或推理擴展。在 SWE-bench 上提升重排序(Best@8 +15.9)、早停(+17.7,嘗試次數減 83%)及資料精選。