Search

Tag: #post-training23 results

新 LLM 幻覺修復僅用 10% 資料

新 LLM 幻覺修復僅用 10% 資料

GitHub 專案發布選擇性對比後訓練程式碼,有效減輕 LLM 幻覺問題。將幻覺視為偏好問題,使用自我產生壞答案進行對比學習,從分歧點後計算損失。透過閘控更新僅用約 10% 資料提升事實性。

Reddit r/MachineLearningCommunityApr 24#contrastive-sampling#post-training
Claude 模型在憲法遵循上表現出色

Claude 模型在憲法遵循上表現出色

研究人員使用對抗性多輪情境,測試 AI 模型對 Anthropic Claude 憲法 205 條原則的遵循度。最新 Claude Sonnet 4.6 和 Opus 4.6 的違反率僅 1.9% 和 2.9%,遠優於先前版本的 7-15%。GPT 模型在 OpenAI 模型規範上也穩步改善,至 1.5% 違反率。

AI Alignment ForumCommunityMar 12#alignment#constitution#post-training
Page 2 of 3