Search

直接匹配不多,已補上最新動態。

Tag: #training-objectives1 results

四種損失函數,四種 LLM 失準模式

四種損失函數,四種 LLM 失準模式

本文主張,不同的 LLM 訓練目標會產生不同形式的失準行為。文章將模仿學習連結至人類惡習、以人類認可為目標的訓練連結至過度奉承、以驗證器為基礎的強化學習連結至「字面精靈」行為,以及以其他 LLM 評價為基礎的訓練連結至「騙徒」行為。

AI Alignment ForumCommunityAug 10#alignment#training-objectives#misalignment