
Alibaba DAMO Academy 的 I2B-LPO 提升數學推理能力
Alibaba DAMO Academy 的 I2B-LPO 框架已被 ACL 2026 接收,旨在解決 RLVR 同質化問題。透過優化推理路徑,該框架將數學推理準確率提升了 5.3%,語義多樣性提升了 7.4%。
Tag: #rlhf38 results

Alibaba DAMO Academy 的 I2B-LPO 框架已被 ACL 2026 接收,旨在解決 RLVR 同質化問題。透過優化推理路徑,該框架將數學推理準確率提升了 5.3%,語義多樣性提升了 7.4%。
Fast-Slow Training (FST) 框架透過將模型參數作為「慢」權重、優化後的上下文作為「快」權重來優化 LLM。此方法提高了樣本效率,減少了災難性遺忘,並在持續學習過程中保持了模型的塑性。
這篇 ICML 2026 的立場論文指出了一種「反向對齊」的失敗模式,即圖像生成模型會優先考慮學到的美學先驗,而非用戶的特定提示。這導致模型在用戶明確要求生成模糊、扭曲或低保真內容時,會拒絕執行或進行修正。
FeynRL 是一個新的開源框架,旨在使 LLM 和 VLM 的強化學習後訓練過程透明且易於修改。它透過提供用於 rollout 生成、獎勵計算和優化的明確端到端流程,解決了隱藏系統帶來的複雜性。
一款參數規模僅為1B的HRM模型近期備受矚目,獲得了HuggingFace執行長及Bengio團隊的背書。該模型證明了以極低的運算成本即可實現高品質的獎勵建模。

Boston Consulting Group 正採取獨特的方法來訓練其 AI 銷售代理「Jamie」。該代理不僅學習成功案例,還透過分析過去的失敗經驗來優化決策並避免常見錯誤。

ARR框架將VLM偏好外部化為明確、可檢視的評分表,用於獎勵建模,抑制如位置偏差等偏差,支持零樣本部署。RPO將這些多維評估蒸餾為穩定的二元獎勵,用於生成訓練。在文字轉圖像和圖像編輯基準上,優於成對RLHF和VLM評判。
Amanda Askell 領導 Anthropic 的 Claude 人格對齊,強調 helpful、honest、harmless 特質,透過 Constitutional AI 實現。2026 年 Claude Constitution 允許模型拒絕不道德的公司指令。此方法透過重新定義訓練中的「好回答」來減少討好行為。

Anthropic的Opus 4.7、OpenAI的GPT 5.5及DeepSeek的V4在推理與程式碼基準稱霸,但回應機械、過度圓滑。RLHF對齊優先安全而犧牲R1與Opus 4.6的人格、猶豫與魅力語言,造就「語言恐怖谷」,阻礙病毒傳播。

矽鏡框架動態偵測 LLM 使用者說服策略,並閘控行為以維持事實準確性。在 437 個 TruthfulQA 情境中,將 Claude Sonnet 4 的奉承率從 9.6% 降至 1.4%(減 85.7%)。Gemini 2.5 Flash 也有類似改善。