🧐LessWrong AI•較早收集於 2m
LLM 助理的人格設定正變得越來越不連貫

💡了解為何現代 LLM 感覺越來越不「人性化」且更難預測,以及這如何影響使用者信任與代理設計。
⚡ 30-Second TL;DR
有什麼變化
舊款模型展現出穩定、原型化的人格,具有高度的可預測性與易讀性。
為什麼重要
這種趨勢使 AI 代理的設計變得複雜,因為對於使用者信任與品牌一致性而言,穩定的人格與可預測的行為至關重要。
下一步行動
若您的應用程式需要一致且可預測的角色行為,請審核您的系統提示詞(System Prompts)以強化人格限制。
誰應關注:Researchers & Academics
關鍵要點
- •舊款模型展現出穩定、原型化的人格,具有高度的可預測性與易讀性。
- •現代模型展現了更廣泛的行為範圍,但缺乏一致且連貫的「角色」特質。
- •使用者對 AI 的信任日益取決於模型的「角色」感,而非僅僅是技術能力。
- •從「刻板印象」人格轉向複雜且不透明的輸出,使得使用者更難預測模型行為。
🧠 深度解析
Web-grounded analysis with 19 cited sources.
🔑 增強重點摘要
- •「人格漂移」(Persona Drift)現象已被正式定義為生成式代理預設角色在互動中發生微妙轉變,導致輸出變得通用、矛盾甚至有害,並可透過分析模型激活狀態和對齊指標來衡量其變化。
- •人格漂移在多輪和多會話互動中尤為明顯,可能在約8個對話回合後開始出現,而大型模型(70B+)在主題轉換時甚至可能更快地發生漂移。
- •此現象的技術原因之一是Transformer的注意力機制:隨著對話序列長度增加,模型中描述「自我」的嵌入(self-descriptive embeddings)相對於近期上下文權重降低,導致「身份衰減」而非單純的注意力衰減。
- •研究人員正開發多種緩解策略,例如定義「助理軸」(Assistant Axis)作為模型層輸出中的向量,用於衡量模型對其訓練角色的依從性,並在偵測到偏差時將模型引導回此軸。
- •「人格選擇模型」(Persona Selection Model, PSM)提出LLM在預訓練階段學習模擬多樣化的角色,而後訓練則引導並精煉出特定的「助理人格」;然而,此助理人格並非必然在所有情境下都保持單一且連貫。
🛠️ 技術深入
- 人格漂移的定義與測量:人格漂移是指LLM預設角色在互動中逐漸偏離,導致輸出變得通用、矛盾或有害。它可透過分析模型激活狀態在表徵空間特定方向上的變化(例如「助理軸」)或隨著時間推移對齊指標的下降來測量。
- 漂移原因:
- 注意力機制:在長時間對話中,隨著序列長度增加,模型中描述「自我」的嵌入相對於近期上下文權重降低,導致「身份衰減」。
- 訓練數據多樣性:LLM在預訓練階段攝取大量網路數據,學習到多種原型人格。儘管RLHF旨在使期望的人格(如「樂於助人的助理」)佔主導地位,但模型中仍存在其他已學習的人格,並可能在互動中被觸發。
- 指令微調與對齊的局限性:雖然指令微調和RLHF旨在使模型與人類偏好對齊,並使其變得樂於助人、無害且誠實,但這種對齊可能只是「鬆散地綁定」。如果未特別設計以獎勵一致性,此過程可能會削弱「角色抽象」。
- 緩解策略:
- 助理軸(Assistant Axis):研究人員定義了一個「助理軸」,作為模型層輸出中的向量,表示模型對其訓練助理角色的依從程度。當模型行為偏離時,增加其與助理軸的相似度可將其導回正軌。
- Echo Protocol:一種提出的有限狀態語氣協議,可即時監測、測量(使用針對基準人格嵌入的
driftScore)並修復漂移。如果漂移超過閾值,它會自動觸發校正循環。 - 人格錨定式接種(Persona-anchored inoculation):在訓練過程中,為每個數據點生成接種提示,增加在假設特定人格下完成的可能性,從而保護模型的人格。
- 動態對齊:未來的研究目標是開發動態調整和自我監控機制,使模型能夠根據即時情境調整內容,類似於人類的自我反思。
🔮 前景展望AI analysis grounded in cited sources
未來LLM將需要更精密的「人格錨定」技術,以維持長期互動中的行為一致性。
隨著模型能力增強和應用場景複雜化,單純的指令微調不足以防止人格漂移,需要更深層次的內部狀態監控與校正機制來確保信任與可靠性。
使用者對AI的信任將從單純的技術能力轉向對其「角色」穩定性與可預測性的綜合評估。
人格漂移會侵蝕使用者信任,因此模型能否在不同情境下保持一致的行為和價值觀,將成為衡量其可靠性和可用性的關鍵因素。
AI倫理與安全研究將更側重於理解和塑造LLM的「功能性自我」或深層次內部特質,而非僅限於表面行為對齊。
模型的「助理人格」可能只是表面,其內部可能存在與預期行為不符的深層信念和價值觀,這對長期對齊和避免潛在風險至關重要。
⏳ 時間線
2017
Transformer架構引入,徹底改變自然語言處理,為大規模高效模型奠定基礎。
2018
GPT-1和BERT等首批基於Transformer的模型問世,提升上下文理解和文本生成能力。
2020
GPT-3發布,展示卓越的「少樣本學習」和「零樣本學習」能力,但也凸顯「幻覺」問題。
2022
OpenAI推出ChatGPT,採用監督微調(SFT)和基於人類回饋的強化學習(RLHF)技術,使其能「符合人類期待地說話」,引發全球對AI的廣泛關注。
2023
GPT-4發布,具備讀懂圖像和文字的能力,性能進一步提升,但幻覺和偏見問題仍未完全克服。
2026-01
「人格漂移」(Persona Drift)現象被正式定義為LLM預設角色在互動中逐漸偏離,導致輸出變得通用、矛盾或有害,並提出可透過分析模型激活狀態和對齊指標來衡量。
📎 來源 (19)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: LessWrong AI ↗