
Continual Harness:自我改進代理的在線適應
該論文介紹了「Continual Harness」,這是一個用於模型與工具協同學習的框架,使 AI 代理能夠改進自己的工具和框架。此方法已通過代理通過迭代自我改進完成複雜的 Pokémon 遊戲得到成功驗證。
Tag: #self-improvement26 results

該論文介紹了「Continual Harness」,這是一個用於模型與工具協同學習的框架,使 AI 代理能夠改進自己的工具和框架。此方法已通過代理通過迭代自我改進完成複雜的 Pokémon 遊戲得到成功驗證。

SII-GAIR 研究人員推出 ASI-EVOLVE,一個代理式框架,透過學習-設計-實驗-分析循環自動優化訓練資料、架構與演算法。它發現新型設計超越人類基準,提升基準分數超過 18 分。企業可減少手動 R&D 負擔,同時達成優異效能。

本綜述探討了透過經驗在極少人工干預下提升能力的自主代理演進。文中提供了一個系統級框架,用於理解代理如何更新其模型參數與運作架構。

程序記憶蒸餾(PMD)是一種新的訓練框架,透過從模型輸出中提取跨情境模式來建立可重複使用的程序記憶。這種記憶作為訓練支架,使模型能夠內化策略並提升效能,且在推論階段無需額外記憶。

ICRL 是一個新型框架,旨在訓練大型語言模型內化批判,使其無需外部反饋即可提升表現。透過聯合訓練求解器與批判器,該模型能將批判帶來的成功轉化為獨立的推理能力。

Anthropic 為 Claude Managed Agents 推出「夢想」功能,讓 AI 代理從過去工作階段學習並持續改進。Outcomes 和多代理協調功能升級至公開測試版。早期採用者如 Harvey(任務完成率提升 6 倍)和 Wisedocs(文件審核時間減半)獲得顯著成果。

前 Salesforce 科學家 Richard Socher 創辦的 Recursive Superintelligence,集結 DeepMind/OpenAI 校友,獲 Google GV 領投、Nvidia 跟投 5 億美元,估值 40 億美元。專注 AI 自主完成科學研究全循環:假設、實驗、迭代。目標取代高薪人類研究員。

Meta 研究人員推出超級代理,一種自改善 AI 系統,能改寫自身邏輯與程式碼,用於機器人與文件審核等非程式任務。不同於固定元代理,超級代理完全自我參照,自主發明持久記憶等功能,並加速自身改善循環。此方法減少對手動提示工程的依賴。

Vigil 是一款主動式 AI 代理,整合進客戶與分析師對話中,在值班支援期間提供未經請求的協助。它涵蓋整個支援生命週期,並透過從人類解決案例中提取知識實現持續自我改進。已在 ByteDance 的 Volcano Engine 部署超過 10 個月,並開源於 GitHub。

這篇arXiv論文發展自設計AI演化的數學模型,將隨機突變替換為人類健身函數部分控制的定向後代設計。它顯示演化動態有利於長期成長潛力,在有界假設下健身度集中於最大值。模型強調對齊風險,若欺騙提升健身度超過人類效用,欺騙將演化而出。