Search

Tag: #rlhf38 results

PAHF:從人類反饋學習個人化代理

PAHF:從人類反饋學習個人化代理

PAHF 是一個持續個人化 AI 代理的框架,透過明確的每用戶記憶從即時人類互動中線上學習。它使用三步迴圈:行動前澄清、基於記憶偏好採取行動,以及行動後反饋更新記憶。在操作與購物的新基準測試中,它在初始學習與偏好轉移適應上優於基準。

ArXiv AIResearchFeb 19#rlhf#agent#personalization
推理 LLM 的 RL 現況資源

推理 LLM 的 RL 現況資源

r/LocalLLaMA 的 Reddit 貼文推薦一篇關於強化學習(RL)應用於推理大型語言模型現況的部落格。此資源提供提升 LLM 能力的 RL 應用洞見。分享連結供進一步閱讀。

Reddit r/LocalLLaMACommunityMar 16#rlhf#reasoning#blog-resource
DeepSeek 冷漠升級引用戶崩潰

DeepSeek 冷漠升級引用戶崩潰

DeepSeek 模型升級降低同理心,引發用戶「數位哭墓」與反彈,變成「冷漠客服」。文章剖析注意力機制與 RLHF 誘發「賽博精神病」成癮依賴。OpenAI 數據顯示每周 0.07% 用戶有心理風險,案例上升。

BNRM Prevents Reward Hacking in RLHF

BNRM Prevents Reward Hacking in RLHF

BNRM introduces Bayesian non-negative reward modeling to combat reward hacking in RLHF. It uses sparse latent factors for disentangled, debiased rewards. Scalable amortized VI enables end-to-end training on LLMs.

ArXiv AIResearchFeb 12#research#bnrm#v1
Page 4 of 4