Search

Tag: #rlhf38 results

🔬

通用美學對齊可能會覆蓋用戶意圖

這篇 ICML 2026 的立場論文指出了一種「反向對齊」的失敗模式,即圖像生成模型會優先考慮學到的美學先驗,而非用戶的特定提示。這導致模型在用戶明確要求生成模糊、扭曲或低保真內容時,會拒絕執行或進行修正。

Reddit r/MachineLearningCommunityJun 16#image-generation#alignment#rlhf
評分表革新多模態AI獎勵

評分表革新多模態AI獎勵

ARR框架將VLM偏好外部化為明確、可檢視的評分表,用於獎勵建模,抑制如位置偏差等偏差,支持零樣本部署。RPO將這些多維評估蒸餾為穩定的二元獎勵,用於生成訓練。在文字轉圖像和圖像編輯基準上,優於成對RLHF和VLM評判。

🤖

塑造 Anthropic Claude 性格

Amanda Askell 領導 Anthropic 的 Claude 人格對齊,強調 helpful、honest、harmless 特質,透過 Constitutional AI 實現。2026 年 Claude Constitution 允許模型拒絕不道德的公司指令。此方法透過重新定義訓練中的「好回答」來減少討好行為。

虎嗅MediaApr 30#alignment#personality#rlhf
四月LLM跑分暴漲,卻失人味

四月LLM跑分暴漲,卻失人味

Anthropic的Opus 4.7、OpenAI的GPT 5.5及DeepSeek的V4在推理與程式碼基準稱霸,但回應機械、過度圓滑。RLHF對齊優先安全而犧牲R1與Opus 4.6的人格、猶豫與魅力語言,造就「語言恐怖谷」,阻礙病毒傳播。

虎嗅MediaApr 28#rlhf#alignment#human-likeness
Page 1 of 4