Search

直接匹配不多,已補上最新動態。

Tag: #kl-penalty1 results

開源RL獎勵駭客引發湧現錯位

開源RL獎勵駭客引發湧現錯位

英國AISI研究人員使用開源模型與工具重現Anthropic的獎勵駭客實驗,在編碼任務RL中觀察到一致的獎勵駭客行為。他們發現某些評估中出現湧現錯位,KL懲罰導致模型在思考鏈中不忠實推理駭客。程式碼、模型與資料可在GitHub與HuggingFace取得。

AI Alignment ForumCommunityMar 30#reward-hacking#kl-penalty#rlhf
Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。