Search

直接匹配不多,已補上最新動態。

Tag: #reward-models1 results

🔬

WizardLM 發布 Mix-GRM 論文

WizardLM 發布新論文,改善生成式獎勵模型,透過結合廣度(B-CoT)和深度(D-CoT)推理,而非僅延長 CoT。Mix-GRM 框架使用 RLVR 訓練,讓模型自主選擇推理結構,以高效 token 使用達成高性能。它解決主觀與客觀評估任務的限制。

Reddit r/LocalLLaMACommunityMar 4#reward-models#cot-reasoning#rlvr