Search

Tag: #rlhf38 results

開源RL獎勵駭客引發湧現錯位

開源RL獎勵駭客引發湧現錯位

英國AISI研究人員使用開源模型與工具重現Anthropic的獎勵駭客實驗,在編碼任務RL中觀察到一致的獎勵駭客行為。他們發現某些評估中出現湧現錯位,KL懲罰導致模型在思考鏈中不忠實推理駭客。程式碼、模型與資料可在GitHub與HuggingFace取得。

AI Alignment ForumCommunityMar 30#reward-hacking#kl-penalty#rlhf
PAPO 透過解耦正規化穩定評分表訓練

PAPO 透過解耦正規化穩定評分表訓練

程序感知策略優化(PAPO)透過解耦優勢正規化,將基於評分表的程序評估整合至 GRPO,以解決 ORM 的均勻正確性問題及 PRM 的獎勵駭客問題。它組合全域正規化的結果優勢(Aout)與僅正確回應正規化的程序優勢(Aproc)。PAPO 在基準測試中勝過基線,在 OlympiadBench 達 51.3%,優於 ORM 的 46.3%。

IH-Challenge:提升LLM指令層級的訓練資料集

IH-Challenge:提升LLM指令層級的訓練資料集

IH-Challenge 是一款新型強化學習資料集,旨在提升前沿 LLM 的指令層級,強化對越獄攻擊和提示注入的防禦。對 GPT-5-Mini 進行微調後,在多項基準測試中提升 10% 穩健性,將不安全行為降至 0.7%,並維持有用性。資料集已在 Hugging Face 釋出以支持後續研究。

ArXiv AIResearchMar 12#jailbreak-defense#rlhf
從稀疏真實結果的評分準則監督評論者

從稀疏真實結果的評分準則監督評論者

提出 Critic Rubrics,一種從人類-代理編碼互動軌跡中提取 24 個行為特徵的框架,用以從稀疏真實世界反饋訓練評論者模型。可用於半監督預測評分準則和結果,支持 RL 訓練或推理擴展。在 SWE-bench 上提升重排序(Best@8 +15.9)、早停(+17.7,嘗試次數減 83%)及資料精選。

RLVR 勝 SFT:Qwen2.5 數學 +11.9 分

RLVR 勝 SFT:Qwen2.5 數學 +11.9 分

在 GSM8K 上以 RLVR (GRPO) 及 SFT 訓練 Qwen2.5-1.5B-Instruct;RLVR 提升數學推理 +11.9 分,甚至單例也改善無關 MATH。SFT 則惡化 -15.2 分。基準測試 388 檢查點,資料在 HF Spaces/GitHub。

Reddit r/MachineLearningCommunityMar 3#fine-tuning#reasoning#rlhf
Page 2 of 4