🤖較早收集於 32h

Continual Harness:自我改進代理的在線適應

Continual Harness:自我改進代理的在線適應
PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning

💡了解自我改進代理如何自動化其工具開發和改進過程。

⚡ 30-Second TL;DR

有什麼變化

引入了用於長程代理的模型與工具協同學習。

為什麼重要

這項研究為構建能夠改進自身操作能力的自主代理提供了藍圖,顯著減少了對手動提示工程的需求。

下一步行動

閱讀 arXiv 上的 'Continual Harness' 論文,了解如何在您自己的代理工作流程中實施自我改進循環。

誰應關注:Researchers & Academics

關鍵要點

  • 引入了用於長程代理的模型與工具協同學習。
  • 代理在執行過程中利用元工具來編輯自己的框架。
  • 迭代改進縮小了 AI 與人類設計系統之間的性能差距。

🧠 深度解析

Web-grounded analysis with 7 cited sources.

🔑 增強重點摘要

  • 「Continual Harness」透過在單一連續運行中進行線上適應,無需像許多提示優化方法那樣重置回合,從而實現自我改進。
  • 該框架採用雙迴圈架構:一個內部迴圈用於代理行動,一個外部迴圈用於線束(harness)精煉,其中一個「精煉器」(Refiner,本身也是一個大型語言模型)會分析軌跡數據以更新系統提示、子代理、技能和記憶體。
  • 除了精煉線束外,「Continual Harness」還透過線上過程獎勵共同學習迴圈,將開源模型的權重納入聯合訓練,利用「前沿教師模型」重新標記運行軌跡來更新模型。
  • 代理從一個最小的環境介面(幀觀察、可見區域的 ASCII 文字地圖和按鈕輸入)開始,無需預先策劃的知識或手工工具,自主地構建其操作支架。
  • 在《寶可夢 紅》和《寶可夢 綠寶石》上的實驗證明,「Continual Harness」從零開始顯著降低了按鈕操作成本,並彌補了與人工設計的專家線束之間的大部分性能差距,展現了與能力相關的收益。

🛠️ 技術深入

  • 最小化介面: 代理僅從幀觀察、可見區域的 ASCII 文字地圖和按鈕輸入開始,不包含任何預先策劃的知識或手工工具。
  • 線束組件: 線束透過四個核心組件來調節代理行為:系統提示(system prompt)、子代理(sub-agents)、技能(skills)和記憶體(memory)。
  • 雙迴圈架構:
    • 內部迴圈(代理步驟): 代理模型(M)由當前線束(Ht)包裹,讀取觀察值(st = ot, mt),並從一組固定的按鈕輸入(A)中選擇一個動作(at)。
    • 外部迴圈(線束精煉): 每隔 F 步,在初始預熱階段 W 步之後,一個「精煉器」(Refiner,通常也是一個大型語言模型)會讀取最近的軌跡窗口(τt-F:t),以識別失敗特徵,例如導航迴圈、工具調用失敗、目標停滯或錯失探索機會。精煉器隨後對每個線束組件執行四次傳遞,發出針對各組件的編輯(Δ)。
  • 線上適應: 與需要回合重置的提示優化方法不同,「Continual Harness」在單一連續回合中進行線上適應。
  • 模型與線束共同學習迴圈: 對於開源模型,該迴圈將自我精煉線束與模型權重更新以無重置方式整合。在預熱階段之後,每個線上迭代都包含一個 DAgger 風格的運行。開源策略在一個即時精煉線束中執行。一個成對的過程獎勵模型(PRM)會對最近軌跡的滑動窗口上的每個轉換進行評分,PRM 的獎勵是軌跡進度、動作正確性、推理品質和格式合規性的加權組合。此 PRM 獎勵用於更新模型。
  • 元工具: 其前身「Gemini Plays Pokémon (GPP)」項目使用了 define_agentrun_codenotepad edits 和自訂工具創建等元工具,使模型能夠在遊戲過程中構建自己的子代理和可重用腳本。

🔮 前景展望AI analysis grounded in cited sources

AI 代理將在複雜的真實世界任務中實現更高的自主性。
這種無需重置的自我改進特性使代理能夠在長期環境中持續適應,從而減少對人類干預和預先設計解決方案的需求。
AI 代理的發展將轉向「模型與線束共同學習」。
該框架證明,同時優化代理的操作支架(線束)和底層模型權重,可以帶來持續的進步和專家級的性能。
AI 系統將能夠從最小的初始介面開始,自主構建和完善自己的工具和知識。
「Continual Harness」從基本的環境介面開始,自主開發其系統提示、子代理、技能和記憶體,預示著一種更通用、更少依賴人類的 AI 開發途徑。

時間線

2025-05
Gemini Plays Pokémon (GPP) 完成《寶可夢 藍》。
2025-08
GPP 在困難模式下擊敗《寶可夢 黃版傳奇》的四天王。
2025-11
GPP 完成《寶可夢 水晶版》,且未在最終戰鬥中失敗。
2026-05-10
論文《Continual Harness: Online Adaptation for Self-Improving Foundation Agents》發表。

📎 來源 (7)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. Google Search Source
  2. Google Search Source
  3. Google Search Source
  4. Google Search Source
  5. Google Search Source
  6. Google Search Source
  7. Google Search Source
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning