Search

直接匹配不多,已補上最新動態。

Tag: #sft-rl3 results

LLM後訓練:能力引發 vs 創造

LLM後訓練:能力引發 vs 創造

這篇arXiv論文區分能力引發(在可及支持內重新加權現有行為)與能力創造(擴展模型可及行為)。它使用自由能框架,SFT透過示範重新加權,RL透過獎勵。焦點轉向後訓練是否維持局部或透過搜尋/工具擴展。

ArXiv AIResearchMay 12#free-energy#sft-rl