Search

Tag: #rlhf38 results

OpenAI GPT-5.5 的哥布林禁令曝光

OpenAI GPT-5.5 的哥布林禁令曝光

開發者 @arb8020 在 OpenAI 的 Codex 儲存庫 models.json 中發現重複指令,指示 GPT-5.5 除非絕對相關,否則絕不提及哥布林、貓妖、浣熊等。 此病毒式發現引發 AI 社群的幽默、猜測及提示工程「粉紅大象」效應討論。Sam Altman 在 X 上幽默回應。

StaRPO:穩定強化學習提升推理可靠性

StaRPO:穩定強化學習提升推理可靠性

StaRPO 提出穩定性增強的強化學習框架,用於大型語言模型,透過 ACF 評估局部連貫性和 PE 評估全局目標導向性,將其與任務獎勵結合提供過程感知反饋。在四個推理基準測試中,顯示出優於基準的準確性和邏輯穩定性。

ArXiv AIResearchApr 13#reasoning-stability#rlhf
TRL v1.0:後訓練庫抵禦領域假設失效

TRL v1.0:後訓練庫抵禦領域假設失效

Hugging Face 發布 TRL v1.0,這是一個後訓練庫,即使 AI 領域推翻其基礎假設仍能持續運作。它支援如 RLHF 等穩健微調方法,應對快速進展。此穩定工具幫助開發者維持可靠模型對齊。

Hugging Face BlogOfficialMar 31#rlhf#ppo#dpo
16 個開源 RL 函式庫的經驗教訓

16 個開源 RL 函式庫的經驗教訓

這篇 Hugging Face 部落格文章提煉了評估 16 個開源強化學習 (RL) 函式庫的關鍵經驗教訓。它強調維持 RL 工作流程中高效 Tokens 流動的策略,這對 LLM 訓練與微調至關重要。從業者可獲得選擇與優化 RL 工具的可行洞見。

Hugging Face BlogOfficialMar 10#rlhf#library-review
Page 3 of 4