Search

直接匹配不多,已補上最新動態。

Tag: #cot-reasoning2 results

🔬

WizardLM 發布 Mix-GRM 論文

WizardLM 發布新論文,改善生成式獎勵模型,透過結合廣度(B-CoT)和深度(D-CoT)推理,而非僅延長 CoT。Mix-GRM 框架使用 RLVR 訓練,讓模型自主選擇推理結構,以高效 token 使用達成高性能。它解決主觀與客觀評估任務的限制。

Reddit r/LocalLLaMACommunityMar 4#reward-models#cot-reasoning#rlvr
推理提升幻覺跨度偵測

推理提升幻覺跨度偵測

大型語言模型常產生幻覺,損害可靠性。本 Apple 研究將幻覺跨度偵測視為多步驟推理任務,評估預訓練模型是否使用 Chain-of-Thought (CoT)。結果顯示 CoT 推理具高度潛力提升效能。

Apple Machine LearningOfficialMar 3#span-detection#cot-reasoning