Search

Tag: #rlvr5 results

Multilingual Reasoning Gym:14 種語言推理環境

Multilingual Reasoning Gym:14 種語言推理環境

Apple 的 Multilingual Reasoning Gym 擴展原 Reasoning Gym,能在 14 種語言生成可驗證推理問題。它包含 94 項任務的翻譯模板,由母語人士在 10 種語言驗證,並調整以確保語言自然性。此健身房保留程序化生成無限實例與可調難度,適合強化學習。

Apple Machine LearningOfficialMar 13#multilingual#reasoning#benchmark
🔬

WizardLM 發布 Mix-GRM 論文

WizardLM 發布新論文,改善生成式獎勵模型,透過結合廣度(B-CoT)和深度(D-CoT)推理,而非僅延長 CoT。Mix-GRM 框架使用 RLVR 訓練,讓模型自主選擇推理結構,以高效 token 使用達成高性能。它解決主觀與客觀評估任務的限制。

Reddit r/LocalLLaMACommunityMar 4#reward-models#cot-reasoning#rlvr
GradLoc Locates RLVR Crash Tokens

GradLoc Locates RLVR Crash Tokens

Tencent Hunyuan's GradLoc tool pinpoints gradient spikes to specific tokens in RLVR training, ending guesswork for collapses. Provides infrastructure for observable RL dynamics in high-noise systems. Open-sourced GitHub lowers engineering barriers for mechanism research.

机器之心MediaFeb 14#research#hunyuan#gradloc