📄較早收集於 17h

OmniToM:評估大型語言模型的心智理論能力

OmniToM:評估大型語言模型的心智理論能力
PostLinkedIn
📄閱讀原文: ArXiv AI

💡了解為何目前的大型語言模型在社會推理上表現不佳,以及如何評估其追蹤複雜心理狀態的能力。

⚡ 30-Second TL;DR

有什麼變化

引入兩階段評估流程:信念提取(Belief Extraction)與信念標記(Belief Labeling)。

為什麼重要

這項研究將心智理論(ToM)評估的重點從簡單的輸出準確度轉向底層推理過程。它為開發者提供了一個診斷模型為何無法理解複雜社會動態的框架。

下一步行動

將 OmniToM 評估流程納入您的模型測試套件中,以識別模型在社會推理與信念追蹤方面的弱點。

誰應關注:Researchers & Academics

關鍵要點

  • 引入兩階段評估流程:信念提取(Belief Extraction)與信念標記(Belief Labeling)。
  • 利用七維度架構來分析知識、意圖與錯誤信念。
  • 在零樣本評估中發現目前大型語言模型存在顯著的「信念追蹤瓶頸」。
  • 基於 895 個故事與 22,343 個標記信念命題,提供穩健的測試基礎。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • OmniToM 透過要求明確的信念結構建模,而非僅評估最終答案,旨在解決現有心智理論(ToM)基準測試的局限性,這些測試常僅衡量「字面心智理論」(預測行為)而非「功能性心智理論」(基於預測理性地調整行為),後者是大型語言模型(LLM)在複雜互動中表現出真正社會智能的關鍵 [2, 6]。
  • 該基準測試發現的「信念追蹤瓶頸」突顯了當前 LLM 在區分信念與知識方面的根本缺陷,這對於需要可靠推理的應用(如醫療諮詢或法律判斷)構成了潛在風險,因為模型可能無法辨析當事人的主觀認知與客觀事實 [11, 12]。
  • OmniToM 引入的兩階段評估流程(信念提取與信念標記)和七維度架構,有助於避免 LLM 透過模式識別或學習關聯等「低層次認知策略」來解決任務,並降低「數據污染」的風險,這些問題是許多直接沿用人類 ToM 測試的 LLM 評估方法所面臨的挑戰 [4]
📊 競品分析▸ Show
基準測試名稱主要特點評估方法發現/局限性
OmniToM引入兩階段評估流程:信念提取與信念標記;利用七維度架構分析知識、意圖與錯誤信念;基於 895 個故事與 22,343 個標記信念命題。透過明確的信念結構建模,而非僅評估最終答案。發現目前 LLM 存在顯著的「信念追蹤瓶頸」,難以處理追蹤動態心理狀態所需的複雜知識獲取與表徵任務。
MoToMQA (Multi-Order Theory of Mind Q&A)專注於高階心智理論任務(2 至 6 階);手寫測試套件,包含短篇故事中的真/假問題。比較五種不同規模和訓練範式的 LLM 與成人人類基準的表現。GPT-4 和 Flan-PaLM 在整體 ToM 任務上達到成人水平或接近成人水平,GPT-4 在 6 階推理上甚至超越成人表現 [1]
ToMBench清華大學團隊提出,包含 8 個任務和 31 種社會認知能力;採用多項選擇題格式;從頭構建雙語庫存以避免數據洩露。系統化評估框架,涵蓋多樣化的真實世界社交場景,有 2,860 個測試樣本。旨在填補現有評估方法範圍狹窄、主觀判斷和潛在數據污染的空白;在更細緻的 ToM 方面,當前模型仍落後於人類表現 [5, 7]。
一般錯誤信念任務被視為評估人類 ToM 的黃金標準,測試個體理解他人可能持有錯誤信念的能力。通常涉及 Sally-Anne 測試等經典情境,要求模型推斷角色基於其錯誤信念的行為。較舊的 LLM 模型(如 GPT-1、GPT-2)在此類任務中失敗,而 GPT-4 在 2023 年 6 月的版本中解決了 75% 的任務,與 6 歲兒童的表現相當 [3, 5, 22]。
FANToM旨在將 LLM 的 ToM 能力推向極限,包含多樣化的社交場景、模糊性和更複雜的問題。專為壓力測試 LLM 在心智理論方面的能力而設計。與人類表現相比,大多數當前模型在處理更細微的 ToM 方面仍然「卡住」 [5]

🔮 前景展望AI analysis grounded in cited sources

大型語言模型將需要更深層次的認知架構來實現真正的心智理論能力。
OmniToM 揭示的「信念追蹤瓶頸」表明,僅憑語言模式學習不足以讓 LLM 掌握動態心理狀態的複雜知識獲取與表徵,需要模型能夠更好地模擬人類的認知過程,例如信念推理和因果推理 [12, 29]。
未來的 LLM 評估將更加側重於互動式和以用戶為中心的場景,以衡量「功能性心智理論」。
現有基準測試的局限性,特別是未能直接測試 LLM 如何適應新夥伴並基於預測採取理性行動,促使研究人員呼籲將 ToM 評估置於動態、交互的社交環境中,並關注模型的適應性和響應性 [4, 6]。
AI 在高風險領域(如醫療和法律)的應用將受到其區分信念與知識能力的嚴重限制,直到心智理論能力得到顯著提升。
當前 LLM 在信念與知識判斷上的缺陷,可能導致在需要辨析當事人主觀認知與客觀事實的應用中出現嚴重錯誤,這對 AI 在這些關鍵領域的可靠性和安全性構成重大挑戰 [11, 12]。

時間線

1950
艾倫·圖靈提出「機器能思考嗎?」的問題,並引入圖靈測試,開啟了對機器心智的哲學探討 [13]。
1978
心理學家 David Premack 和 Guy Woodruff 首次提出「心智理論」(Theory of Mind, ToM)概念,用於研究黑猩猩推斷他人心理狀態的能力 [1, 17, 35]。
1983
Wimmer 和 Perner 提出「錯誤信念任務」,成為評估人類 ToM 的黃金標準,後被廣泛應用於 AI 領域 [3, 22, 35]。
2022-11
GPT-3-davinci-003 模型在錯誤信念任務中解決了 20% 的任務,顯示出 LLM 在 ToM 能力上的初步進展 [3, 5]。
2023-06
ChatGPT-4 模型在錯誤信念任務中解決了 75% 的任務,表現與 6 歲兒童相當,引發了關於 ToM 能力可能在 LLM 中「自發湧現」的討論 [3, 5, 17]。
2025-05
北京大學團隊發布首篇大語言模型心理測量學系統綜述,探討如何科學評估 LLM 的「心智」特徵,並將心理測量學引入 LLM 評估 [27]。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI