Search

直接匹配不多,已補上最新動態。

Tag: #weak-to-strong2 results

弱模型修復強模型的推理錯誤

弱模型修復強模型的推理錯誤

Woodpecker Distillation 顯示,強大語言模型的失敗往往源於中間推理步驟中的局部錯誤,而非整體能力不足。該方法利用弱模型的對比式介入與後續 token 分布,在數學推理基準上提升強模型的表現。

ArXiv AIResearchAug 7#reasoning#weak-to-strong