Search

直接匹配不多,已補上最新動態。

Tag: #curriculum-learning4 results

Goldilocks RL:調整任務難度提升LLM推理

Goldilocks RL:調整任務難度提升LLM推理

Apple 推出 Goldilocks RL,一種教師驅動的資料取樣策略,為學生模型預測問題難度,用於強化學習。它透過動態調整任務難度解決 LLM 推理中的稀疏獎勵問題,提升樣本效率,優於靜態課程學習。此方法有助模型以最小回饋探索廣大搜尋空間。

Apple Machine LearningOfficialMar 18#curriculum-learning#llm-reasoning
HEAL:突破教師上限的推理蒸餾

HEAL:突破教師上限的推理蒸餾

HEAL 是一種無 RL 框架,從大型推理模型蒸餾推理能力至小型模型,克服拒絕採樣限制與「教師上限」。它整合 GEAR 用於熵引導軌跡修復、PURE 篩選真實突破,以及 PACE 漸進課程學習。實驗顯示在多項基準優於 SFT 與基線。

ArXiv AIResearchMar 12#entropy-repair#curriculum-learning
Trace-Free+:改寫工具提升 LLM 代理

Trace-Free+:改寫工具提升 LLM 代理

Trace-Free+ 是一種課程學習框架,用於在無執行追蹤的情況下優化 LLM 代理的工具描述。它透過從追蹤豐富環境轉移監督至無追蹤部署,利用從多樣工具建構的大規模資料集。StableToolBench 和 RestBench 實驗顯示,對未見工具有顯著提升、跨領域泛化,並可擴展至超過 100 個候選工具。

Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。