🤖Reddit r/MachineLearning•較早收集於 32h
Continual Harness:自我改進代理的在線適應

💡了解自我改進代理如何自動化其工具開發和改進過程。
⚡ 30-Second TL;DR
有什麼變化
引入了用於長程代理的模型與工具協同學習。
為什麼重要
這項研究為構建能夠改進自身操作能力的自主代理提供了藍圖,顯著減少了對手動提示工程的需求。
下一步行動
閱讀 arXiv 上的 'Continual Harness' 論文,了解如何在您自己的代理工作流程中實施自我改進循環。
誰應關注:Researchers & Academics
關鍵要點
- •引入了用於長程代理的模型與工具協同學習。
- •代理在執行過程中利用元工具來編輯自己的框架。
- •迭代改進縮小了 AI 與人類設計系統之間的性能差距。
🧠 深度解析
Web-grounded analysis with 7 cited sources.
🔑 增強重點摘要
- •「Continual Harness」透過在單一連續運行中進行線上適應,無需像許多提示優化方法那樣重置回合,從而實現自我改進。
- •該框架採用雙迴圈架構:一個內部迴圈用於代理行動,一個外部迴圈用於線束(harness)精煉,其中一個「精煉器」(Refiner,本身也是一個大型語言模型)會分析軌跡數據以更新系統提示、子代理、技能和記憶體。
- •除了精煉線束外,「Continual Harness」還透過線上過程獎勵共同學習迴圈,將開源模型的權重納入聯合訓練,利用「前沿教師模型」重新標記運行軌跡來更新模型。
- •代理從一個最小的環境介面(幀觀察、可見區域的 ASCII 文字地圖和按鈕輸入)開始,無需預先策劃的知識或手工工具,自主地構建其操作支架。
- •在《寶可夢 紅》和《寶可夢 綠寶石》上的實驗證明,「Continual Harness」從零開始顯著降低了按鈕操作成本,並彌補了與人工設計的專家線束之間的大部分性能差距,展現了與能力相關的收益。
🛠️ 技術深入
- 最小化介面: 代理僅從幀觀察、可見區域的 ASCII 文字地圖和按鈕輸入開始,不包含任何預先策劃的知識或手工工具。
- 線束組件: 線束透過四個核心組件來調節代理行為:系統提示(system prompt)、子代理(sub-agents)、技能(skills)和記憶體(memory)。
- 雙迴圈架構:
- 內部迴圈(代理步驟): 代理模型(M)由當前線束(Ht)包裹,讀取觀察值(st = ot, mt),並從一組固定的按鈕輸入(A)中選擇一個動作(at)。
- 外部迴圈(線束精煉): 每隔 F 步,在初始預熱階段 W 步之後,一個「精煉器」(Refiner,通常也是一個大型語言模型)會讀取最近的軌跡窗口(τt-F:t),以識別失敗特徵,例如導航迴圈、工具調用失敗、目標停滯或錯失探索機會。精煉器隨後對每個線束組件執行四次傳遞,發出針對各組件的編輯(Δ)。
- 線上適應: 與需要回合重置的提示優化方法不同,「Continual Harness」在單一連續回合中進行線上適應。
- 模型與線束共同學習迴圈: 對於開源模型,該迴圈將自我精煉線束與模型權重更新以無重置方式整合。在預熱階段之後,每個線上迭代都包含一個 DAgger 風格的運行。開源策略在一個即時精煉線束中執行。一個成對的過程獎勵模型(PRM)會對最近軌跡的滑動窗口上的每個轉換進行評分,PRM 的獎勵是軌跡進度、動作正確性、推理品質和格式合規性的加權組合。此 PRM 獎勵用於更新模型。
- 元工具: 其前身「Gemini Plays Pokémon (GPP)」項目使用了
define_agent、run_code、notepad edits和自訂工具創建等元工具,使模型能夠在遊戲過程中構建自己的子代理和可重用腳本。
🔮 前景展望AI analysis grounded in cited sources
AI 代理將在複雜的真實世界任務中實現更高的自主性。
這種無需重置的自我改進特性使代理能夠在長期環境中持續適應,從而減少對人類干預和預先設計解決方案的需求。
AI 代理的發展將轉向「模型與線束共同學習」。
該框架證明,同時優化代理的操作支架(線束)和底層模型權重,可以帶來持續的進步和專家級的性能。
AI 系統將能夠從最小的初始介面開始,自主構建和完善自己的工具和知識。
「Continual Harness」從基本的環境介面開始,自主開發其系統提示、子代理、技能和記憶體,預示著一種更通用、更少依賴人類的 AI 開發途徑。
⏳ 時間線
2025-05
Gemini Plays Pokémon (GPP) 完成《寶可夢 藍》。
2025-08
GPP 在困難模式下擊敗《寶可夢 黃版傳奇》的四天王。
2025-11
GPP 完成《寶可夢 水晶版》,且未在最終戰鬥中失敗。
2026-05-10
論文《Continual Harness: Online Adaptation for Self-Improving Foundation Agents》發表。
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗