Search

Tag: #alignment84 results

大型語言模型的人格選擇模型

大型語言模型的人格選擇模型

人格選擇模型(PSM)提出,大型語言模型(LLM)在預訓練期間學習模擬多樣人格,後訓練則引出並精煉特定「助理」人格。使用者互動被視為與此類角色實體的互動。行為、泛化與可解釋性實證支持PSM,並影響AI開發策略如擬人化推理。

AI Alignment ForumCommunityFeb 23#persona-simulation#ai-psychology#alignment
四種損失函數,四種 LLM 失準模式

四種損失函數,四種 LLM 失準模式

本文主張,不同的 LLM 訓練目標會產生不同形式的失準行為。文章將模仿學習連結至人類惡習、以人類認可為目標的訓練連結至過度奉承、以驗證器為基礎的強化學習連結至「字面精靈」行為,以及以其他 LLM 評價為基礎的訓練連結至「騙徒」行為。

AI Alignment ForumCommunityAug 10#alignment#training-objectives#misalignment
LLM Shoggoth 迷因與 AI 對齊

LLM Shoggoth 迷因與 AI 對齊

本文探討了將大型語言模型(LLM)比喻為「修格斯」(shoggoth)的迷因,並將其與洛夫克拉夫特式的恐怖與人工智慧本質進行對照。文章分析了 AI 模型如何作為模仿者,在缺乏內在理性利益的情況下模擬人類角色。

LessWrong AICommunityJul 6#ai-safety#alignment#philosophy
Page 7 of 9