📄較早收集於 5h

LLM 世界模型規劃的新範式

LLM 世界模型規劃的新範式
PostLinkedIn
📄閱讀原文: ArXiv AI
#llm-agents#world-models#reasoningunified-agentic-training-paradigmarxiv

💡了解如何讓 LLM 代理從反應式回應轉變為具備基礎的預測性「假設」規劃。

⚡ 30-Second TL;DR

有什麼變化

引入三階段訓練範式:WM-AMT、FE-SFT 和 FC-RL。

為什麼重要

這項研究為構建超越反應式行為的自主代理提供了路線圖。它表明將前瞻性建立在預測性訓練基礎上,對於可靠的長程規劃至關重要。

下一步行動

在代理的 SFT 階段加入「前瞻」軌跡生成步驟,以提高其推理校準能力。

誰應關注:Researchers & Academics

關鍵要點

  • 引入三階段訓練範式:WM-AMT、FE-SFT 和 FC-RL。
  • 解決了代理在缺乏預測基礎下僅能模仿前瞻性的「格式-能力差距」問題。
  • 在搜尋和數學推理任務中表現優於現有基準。
  • 使用文字版的 Q-value 類比來進行計畫條件下的成功預估。

🧠 深度解析

本篇為 AI 生成分析,非原文內容。

🔑 增強重點摘要

  • 該研究提出的世界模型訓練框架,特別強調了將環境動態(Environment Dynamics)編碼為隱式文字序列,而非依賴外部模擬器。
  • WM-AMT(World Model-Aware Model Training)階段利用了大規模未標註的軌跡數據,透過預測下一個狀態來增強模型的因果推理能力。
  • FE-SFT(Future-Event Supervised Fine-Tuning)引入了反事實推理數據集,使模型能夠在給定不同行動路徑下生成多樣化的未來情境。
  • FC-RL(Future-Conditioned Reinforcement Learning)利用文字化的 Q-value 估計,解決了傳統 RL 在長程規劃中獎勵稀疏的問題。
  • 此範式顯著降低了代理在複雜決策任務中對『試錯法』(Trial-and-Error)的依賴,將探索成本從環境轉移至模型內部的模擬空間。
📊 競品分析▸ Show
特性/模型本研究 (World Model LLM)Q* (OpenAI)ReAct / ToT
規劃機制內化世界模型模擬隱式 Q-value 搜尋提示詞工程/樹狀搜尋
訓練階段三階段 (WM/FE/FC)未公開無 (推理時)
基準表現數學/搜尋任務領先數學/邏輯極高中等
依賴性低 (內建模擬)高 (需搜尋)高 (需外部環境)

🛠️ 技術深入

  • 狀態表示:將環境狀態映射為高維文字嵌入,並透過自回歸方式預測狀態轉移函數 P(s'|s, a)。
  • 價值函數估計:採用文字化 Q-value,即模型直接輸出一個代表預期回報的數值 token,並透過監督學習進行校準。
  • 訓練目標:最小化預測未來狀態的交叉熵損失與規劃路徑的策略梯度損失之加權和。
  • 推理時策略:在執行動作前,模型會進行多輪內部模擬(Internal Rollouts),並選擇累積 Q-value 最高的路徑。

🔮 前景展望AI analysis grounded in cited sources

LLM 代理將從『反應式』轉向『預測式』架構。
透過內化世界模型,代理不再僅依賴即時輸入,而是能主動模擬未來結果,大幅提升在未知環境中的生存率。
推理成本將從執行階段轉移至訓練階段。
將規劃能力內化至模型參數中,可減少推理時對複雜提示詞或多次外部 API 呼叫的需求。

時間線

2025-03
研究團隊初步提出基於文字序列的環境狀態建模概念。
2025-11
完成 WM-AMT 訓練框架的初步驗證,證明模型具備基礎預測能力。
2026-04
整合 FC-RL 模組,正式確立三階段訓練範式並在數學基準測試中取得突破。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。