Search

直接匹配不多,已補上最新動態。

Tag: #verifiable-rewards1 results

使用 GRPO 實現可驗證獎勵強化學習

使用 GRPO 實現可驗證獎勵強化學習

學習在 SageMaker 上實施可驗證獎勵強化學習 (RLVR),引入獎勵信號的驗證與透明度,提升訓練效能。結合 Group Relative Policy Optimization (GRPO) 和少樣本範例,改善數學問題解決準確度,使用 GSM8K 資料集,但適用於程式碼生成等任務。

AWS Machine Learning BlogOfficialMay 7#verifiable-rewards#math-reasoning
Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。