📄ArXiv AI•較早收集於 9h
LLM 在因果推論上失敗;A-CBO 提供了解決方案

💡了解為何 LLM 在因果發現上存在根本性失敗,以及代理迴圈如何繞過這些內在限制。
⚡ 30-Second TL;DR
有什麼變化
證明了「核心阻礙定理」,顯示 LLM 無法區分產生相似觀測數據的因果圖。
為什麼重要
這項研究將焦點從擴展模型參數轉向因果推理的架構創新。它表明,代理(Agents)而非更大的模型,才是解決複雜科學與邏輯任務的關鍵。
下一步行動
如果您的應用程式需要因果推理,請停止依賴微調,並實作 A-CBO 風格的代理迴圈來查詢干預效果。
誰應關注:Researchers & Academics
關鍵要點
- •證明了「核心阻礙定理」,顯示 LLM 無法區分產生相似觀測數據的因果圖。
- •推出了 A-CBO,結合凍結的 LLM 與貝葉斯迴圈,無需重新訓練即可進行因果發現。
- •在 24 變數的 Extended Corr2Cause 基準測試中,A-CBO 的表現優於微調模型與偏好優化模型。
- •該方法透過在標準學習範式之外運作,避免了模型內部表示無限增長的需求。
🧠 深度解析
Web-grounded analysis with 17 cited sources.
🔑 增強重點摘要
- •大型語言模型(LLM)在因果推論上的根本限制源於其主要透過大量文本數據進行訓練,缺乏真實世界的語境,導致難以區分相關性與因果關係。
- •儘管存在這些限制,較新的LLM模型,如GPT-5和Gemini 2.5 Pro,已展現出進行因果分析的能力,甚至能應用反事實和亞里斯多德等不同視角,並在因果關係判斷上達到88-91%的高度一致性,遠高於傳統的人工標註者之間30-70%的一致性。
- •「因果AI」的概念旨在建立因果模型,以基於因果關係而非僅僅相關性進行推論,從而提供純粹預測性AI模型可能無法從歷史數據中提取的洞察。
- •LLM在因果發現中可扮演多種角色,包括直接推論(在沒有數據的情況下直接提出因果圖)、事後精煉(審查和調整統計生成的圖)或先驗知識注入(將LLM知識作為約束嵌入算法中)。
- •「核心阻礙定理」揭示了LLM無法區分產生相似觀測數據的因果圖,這表明它們在超越模式識別的真正因果理解方面存在局限性。
📊 競品分析▸ Show
| 特徵/模型 | 方法類型 | 因果發現方法 | Corr2Cause基準測試表現 (F1分數) | 備註 |
|---|---|---|---|---|
| A-CBO (本文) | LLM與貝葉斯優化混合 | 結合凍結LLM作為干預預言機與貝葉斯迴圈 | 優於微調模型與偏好優化模型 (24變數Extended Corr2Cause) [cite: article] | 避免模型內部表示無限增長的需求 |
| 傳統約束型算法 | 統計 | PC算法、FCI (Fast Causal Inference) | 無直接數據,通常依賴條件獨立性測試 | 依賴數據中的統計模式,可能無法處理複雜語義 |
| 傳統基於分數型算法 | 統計 | GES (Greedy Equivalence Search)、DirectLinGAM | 無直接數據,透過評分函數評估圖的質量 | 旨在找到最符合數據的模型 |
| ALCM (Khatibi et al., 2024) | LLM增強混合 | 結合統計發現步驟、翻譯層和LLM驅動的精煉器 | 在七個基準數據集上優於獨立LLM和傳統方法 | 首批完全自動化端到端因果發現系統之一 |
| GPT-4 (直接推論) | LLM | 直接從相關性陳述推斷因果關係 | 約29.08 (Corr2Cause) | 表現僅略優於隨機基準,泛化能力有限 |
| Qwen3-32B (結構化方法) | LLM增強 | 透過圖形化中間表示來結構化推理 | 從32.71提升至48.26 (Corr2Cause) | 顯著提高了F1分數和召回率,對分佈外查詢更具魯棒性 |
| LLM-BFS, LLM-greedy, ChatPC | LLM增強混合 | 結合LLM與傳統因果發現算法 | 無直接數據,旨在增強因果推論任務的性能 | 利用LLM作為虛擬領域專家 |
| Causal Bayesian Optimization (CBO) | 貝葉斯優化 | 利用已知因果關係進行干預以優化結果變量 | 無直接數據,需要預先指定因果圖 | 泛化了貝葉斯優化,考慮了因果信息 |
| Graph Agnostic Causal Bayesian Optimization (GACBO) | 貝葉斯優化 | 在因果圖未知或部分已知的情況下進行優化 | 在模擬實驗和真實世界應用中優於基準 | 平衡利用與探索,將因果發現作為子任務整合 |
🛠️ 技術深入
- 核心阻礙定理 (Kernel Obstruction Theorem):該定理證明了LLM在因果發現中存在根本性限制,因為它們無法區分產生相似觀測數據的不同因果圖。這意味著LLM可能無法從數據中推斷出真正的因果結構,而僅僅是識別出相關模式。 [cite: article, 29, 33]
- Agentic Causal Bayesian Optimization (A-CBO):這是一種新穎的因果發現方法,它結合了凍結的LLM與貝葉斯優化迴圈。 [cite: article]
- 凍結的LLM作為干預預言機 (Frozen LLM as an Intervention Oracle):在A-CBO框架中,LLM被用作一個「預言機」,提供權威性的答案、驗證或在計算流程中調解邏輯。它在因果推論中扮演著決策性的角色,例如生成和驗證推理步驟。 [cite: article, 21, 22]
- 貝葉斯迴圈 (Bayesian Loop):A-CBO利用貝葉斯迴圈來迭代地引導干預並更新對因果圖的信念。這通常涉及在未知因果圖的情況下,透過學習目標變量的直接因果父節點的貝葉斯後驗分佈來優化結果變量,同時學習因果結構。 [cite: article, 35, 44, 47]
- 無需重新訓練 (No Retraining):A-CBO的關鍵優勢在於它利用凍結的LLM,這意味著在進行因果發現時無需對LLM進行額外的訓練或微調,從而避免了模型內部表示無限增長的需求。 [cite: article]
- Extended Corr2Cause基準測試:A-CBO在24變數的Extended Corr2Cause基準測試中表現優於現有方法。Corr2Cause是一個旨在測試LLM純粹因果推論能力的基準數據集,它要求模型從一系列相關性陳述中判斷因果關係。 [cite: article, 36, 42]
🔮 前景展望AI analysis grounded in cited sources
因果AI將成為實現通用人工智慧(AGI)的關鍵組成部分。
Google DeepMind在2024年的一篇論文中數學證明,任何能夠適應足夠大分佈變化的智能體都必須學習因果模型,這表明因果AI對於超越原始訓練集的泛化能力至關重要。
LLM將更深入地融入科學研究流程,扮演類似人類協作者的角色。
隨著LLM能力的提升,它們有望在科學工作流程中承擔更多角色,例如協助開發和討論想法,從而改變科學實踐的方式。
未來的因果分析將從文本註釋轉向對語義的深層理解,LLM將在解決數據稀疏性方面發揮作用。
LLM有望幫助解決帶註釋數據的稀疏性問題,並將文本中的因果分析重點從簡單的註釋轉移到更深層次的語義理解。
⏳ 時間線
1923-XX
Jersey Neyman引入了因果效應的符號表示,其中包含反事實概念。
1935-XX
R. A. Fisher的《實驗設計》引入了隨機分配的概念,成為隨機對照試驗的基礎。
2017-XX
Google發表了關於Transformer網絡的論文,為現代大型語言模型奠定了基礎。
2018-XX
圖靈獎得主Judea Pearl的《The Book of Why》強調機器缺乏因果理解是實現人類級智能的最大障礙。
2020-XX
哥倫比亞大學成立了由Elias Bareinboim領導的因果AI實驗室。
2022-XX
Gartner首次將因果AI納入其炒作週期報告,稱其為加速AI自動化的五項關鍵技術之一。
2023-06
Corr2Cause基準數據集被提出,旨在測試大型語言模型的純粹因果推論能力。
2024-XX
Google DeepMind的一篇論文從數學上證明,任何能夠適應足夠大分佈變化的智能體都必須學習因果模型,這表明因果AI對於實現通用人工智慧至關重要。
📎 來源 (17)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗