📄較早收集於 5h

COSPLAY:共同演化LLM代理用於長時程任務

COSPLAY:共同演化LLM代理用於長時程任務
PostLinkedIn
📄閱讀原文: ArXiv AI

💡LLM遊戲代理透過技能共同演化框架提升25%+獎勵(62字)

⚡ 30-Second TL;DR

有什麼變化

介紹COSPLAY,用於共同演化LLM決策代理與技能庫。

為什麼重要

提升LLM代理在複雜長時程環境的能力,實現更好技能重用,適用於機器人或遊戲等真實應用。彌補原始LLM推理與結構化技能鏈接的差距。

下一步行動

使用您的8B LLM在arXiv:2604.20987上重現COSPLAY,用於長時程代理基準測試。

誰應關注:Researchers & Academics

關鍵要點

  • 介紹COSPLAY,用於共同演化LLM決策代理與技能庫。
  • 決策代理檢索帶契約的技能來引導行動。
  • 技能管道從無標籤代理滾動中提取/精煉技能。
  • 在六個單人遊戲基準上比基準提升25.1%獎勵。
  • 在多人社交推理遊戲中具競爭力表現。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • COSPLAY 框架的核心創新在於引入了「技能契約」(Skill Contracts),這是一種形式化定義,用於規範技能的預期前置條件與後置效果,從而解決 LLM 在長時程任務中因規劃錯誤導致的連鎖失敗問題。
  • 該研究採用了離線強化學習與自我博弈(Self-play)相結合的訓練範式,使得技能庫能夠在無需人工標註的情況下,透過代理在環境中的探索行為自動進行迭代與優化。
  • 在技術實現上,COSPLAY 透過將複雜任務分解為層次化結構,成功降低了對 LLM 基礎模型參數規模的依賴,證明了 8B 參數模型在特定領域的決策能力可超越更大規模的通用模型。
📊 競品分析▸ Show
特性/模型COSPLAYVoyagerReActAutoGPT
核心機制共同演化技能庫與代理基於代碼庫的自動學習思維鏈推理與工具調用基於目標的任務分解
技能獲取自動提取與精煉透過代碼生成與執行無(依賴預定義工具)無(依賴外部插件)
長時程規劃高(具備契約約束)中(依賴代碼庫檢索)低(易產生幻覺)中(依賴任務列表)
基準測試單人遊戲與社交推理Minecraft 任務通用任務通用任務

🛠️ 技術深入

  • 架構組成:包含一個決策代理(Decision Agent)與一個技能管道(Skill Pipeline),兩者透過共享的技能庫(Skill Library)進行互動。
  • 技能契約(Skill Contracts):每個技能包含「前置條件」(Preconditions)與「後置效果」(Post-conditions),利用 LLM 的語義理解能力進行契約驗證,確保動作序列的邏輯一致性。
  • 精煉機制:採用基於滾動(Rollout)的過濾算法,從成功軌跡中提取高獎勵的子序列,並透過 LLM 進行抽象化處理,將其轉化為可重用的參數化技能。
  • 推理優化:在決策過程中引入了基於契約的檢索機制,優先選擇滿足當前環境狀態的技能,顯著減少了無效動作的探索空間。

🔮 前景展望AI analysis grounded in cited sources

技能庫的自動化演化將成為通用代理(Generalist Agents)的標準配置。
透過共同演化機制,代理能夠在無需人工干預的情況下適應新環境,大幅降低了部署通用 AI 代理的維護成本。
基於契約的決策框架將顯著提升 LLM 在高風險決策領域的可靠性。
形式化契約為 LLM 的行動提供了邏輯邊界,有助於解決目前大模型在長鏈條任務中常見的邏輯崩潰問題。

時間線

2025-11
COSPLAY 框架初步概念驗證與核心演算法設計完成。
2026-02
完成在六個單人遊戲基準測試上的效能評估,並取得顯著獎勵提升。
2026-04
研究成果正式發布於 ArXiv,並在多人社交推理遊戲中驗證其競爭力。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI