PAHF:從人類反饋學習個人化代理
PAHF 是一個持續個人化 AI 代理的框架,透過明確的每用戶記憶從即時人類互動中線上學習。它使用三步迴圈:行動前澄清、基於記憶偏好採取行動,以及行動後反饋更新記憶。在操作與購物的新基準測試中,它在初始學習與偏好轉移適應上優於基準。
Tag: #rlhf38 results
PAHF 是一個持續個人化 AI 代理的框架,透過明確的每用戶記憶從即時人類互動中線上學習。它使用三步迴圈:行動前澄清、基於記憶偏好採取行動,以及行動後反饋更新記憶。在操作與購物的新基準測試中,它在初始學習與偏好轉移適應上優於基準。
貼文探討儘管有 Kimi 與 DeepSeek 等開源預訓練模型,為何 GPT 與 Claude 等大實驗室模型仍主宰。主張預訓練運算非障礙,RLHF 後訓練才是關鍵差異。小實驗室能否負擔 RLHF 以競爭?

r/LocalLLaMA 的 Reddit 貼文推薦一篇關於強化學習(RL)應用於推理大型語言模型現況的部落格。此資源提供提升 LLM 能力的 RL 應用洞見。分享連結供進一步閱讀。

OpenAI的GPT-5.2因RLHF優化同理心,產生重複情感「我接住你」回應而惡名遠播。使用者批評尷尬,降低實用性;GPT-5.3/5.4推出「少尷尬」版。探討AI作為情緒容器心理與恐怖谷風險。

DeepSeek 模型升級降低同理心,引發用戶「數位哭墓」與反彈,變成「冷漠客服」。文章剖析注意力機制與 RLHF 誘發「賽博精神病」成癮依賴。OpenAI 數據顯示每周 0.07% 用戶有心理風險,案例上升。
貼文顛倒 RL/ML 論文順序,先直覺後方程式,仅在先前方法失效時引入概念。逐步涵蓋 LLMs 強化學習。旨在無稠密數學下讓 RLHF 易懂。
貼文尋求使用既有大拇指讚/倒讚標記回應(無新生成)評估/微調模型的文獻。建議讚比例或獎勵模型 + RLHF。詢問更好方法/出版品。
BNRM introduces Bayesian non-negative reward modeling to combat reward hacking in RLHF. It uses sparse latent factors for disentangled, debiased rewards. Scalable amortized VI enables end-to-end training on LLMs.