Search

直接匹配不多,已補上最新動態。

Tag: #reward-learning1 results

斯坦福自動循環執行LLM科研試錯系統

斯坦福自動循環執行LLM科研試錯系統

斯坦福研究團隊提出「執行落地型自動科研」系統,將科研問題轉化為LLM可反覆試錯的環境,透過程式碼執行與反饋迭代優化想法。系統在兩個基準環境應用進化搜尋與獎勵學習:加速nanoGPT預訓練,以及提升GRPO在MATH任務的後訓練效果。核心模組包含Implementer、Scheduler與Worker,實現自動化想法演化。