📄ArXiv AI•較早收集於 5h
COSPLAY:共同演化LLM代理用於長時程任務

💡LLM遊戲代理透過技能共同演化框架提升25%+獎勵(62字)
⚡ 30-Second TL;DR
有什麼變化
介紹COSPLAY,用於共同演化LLM決策代理與技能庫。
為什麼重要
提升LLM代理在複雜長時程環境的能力,實現更好技能重用,適用於機器人或遊戲等真實應用。彌補原始LLM推理與結構化技能鏈接的差距。
下一步行動
使用您的8B LLM在arXiv:2604.20987上重現COSPLAY,用於長時程代理基準測試。
誰應關注:Researchers & Academics
關鍵要點
- •介紹COSPLAY,用於共同演化LLM決策代理與技能庫。
- •決策代理檢索帶契約的技能來引導行動。
- •技能管道從無標籤代理滾動中提取/精煉技能。
- •在六個單人遊戲基準上比基準提升25.1%獎勵。
- •在多人社交推理遊戲中具競爭力表現。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •COSPLAY 框架的核心創新在於引入了「技能契約」(Skill Contracts),這是一種形式化定義,用於規範技能的預期前置條件與後置效果,從而解決 LLM 在長時程任務中因規劃錯誤導致的連鎖失敗問題。
- •該研究採用了離線強化學習與自我博弈(Self-play)相結合的訓練範式,使得技能庫能夠在無需人工標註的情況下,透過代理在環境中的探索行為自動進行迭代與優化。
- •在技術實現上,COSPLAY 透過將複雜任務分解為層次化結構,成功降低了對 LLM 基礎模型參數規模的依賴,證明了 8B 參數模型在特定領域的決策能力可超越更大規模的通用模型。
📊 競品分析▸ Show
| 特性/模型 | COSPLAY | Voyager | ReAct | AutoGPT |
|---|---|---|---|---|
| 核心機制 | 共同演化技能庫與代理 | 基於代碼庫的自動學習 | 思維鏈推理與工具調用 | 基於目標的任務分解 |
| 技能獲取 | 自動提取與精煉 | 透過代碼生成與執行 | 無(依賴預定義工具) | 無(依賴外部插件) |
| 長時程規劃 | 高(具備契約約束) | 中(依賴代碼庫檢索) | 低(易產生幻覺) | 中(依賴任務列表) |
| 基準測試 | 單人遊戲與社交推理 | Minecraft 任務 | 通用任務 | 通用任務 |
🛠️ 技術深入
- 架構組成:包含一個決策代理(Decision Agent)與一個技能管道(Skill Pipeline),兩者透過共享的技能庫(Skill Library)進行互動。
- 技能契約(Skill Contracts):每個技能包含「前置條件」(Preconditions)與「後置效果」(Post-conditions),利用 LLM 的語義理解能力進行契約驗證,確保動作序列的邏輯一致性。
- 精煉機制:採用基於滾動(Rollout)的過濾算法,從成功軌跡中提取高獎勵的子序列,並透過 LLM 進行抽象化處理,將其轉化為可重用的參數化技能。
- 推理優化:在決策過程中引入了基於契約的檢索機制,優先選擇滿足當前環境狀態的技能,顯著減少了無效動作的探索空間。
🔮 前景展望AI analysis grounded in cited sources
技能庫的自動化演化將成為通用代理(Generalist Agents)的標準配置。
透過共同演化機制,代理能夠在無需人工干預的情況下適應新環境,大幅降低了部署通用 AI 代理的維護成本。
基於契約的決策框架將顯著提升 LLM 在高風險決策領域的可靠性。
形式化契約為 LLM 的行動提供了邏輯邊界,有助於解決目前大模型在長鏈條任務中常見的邏輯崩潰問題。
⏳ 時間線
2025-11
COSPLAY 框架初步概念驗證與核心演算法設計完成。
2026-02
完成在六個單人遊戲基準測試上的效能評估,並取得顯著獎勵提升。
2026-04
研究成果正式發布於 ArXiv,並在多人社交推理遊戲中驗證其競爭力。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗