
GLM 對決 DeepSeek:自進化競賽正式開跑
據報導,智譜精準對準 DeepSeek,並在八項基準測試中贏得七項。文章認為,更關鍵的競爭在於雙方不同的自進化策略,而長期成果仍未見分曉。
Tag: #self-evolution11 results

據報導,智譜精準對準 DeepSeek,並在八項基準測試中贏得七項。文章認為,更關鍵的競爭在於雙方不同的自進化策略,而長期成果仍未見分曉。

Milkyway 是一個自我演化 LLM 代理系統,利用重複預測未解決問題的內部反饋更新持久化 harness。它改善因素追蹤、證據收集和不確定性處理,而不改變基礎模型。在 FutureX (60.90) 和 FutureWorld (77.96) 上取得最佳分數。

EverMind 宣稱透過三篇研究論文,提出首個全棧自進化框架。文章將這項工作定位為快速成長、並吸引海外團隊投入的 NeoLab 浪潮之一。

RSEA 引入了一種讓 LLM 代理透過嚴格的留出驗證(held-out selection)機制,來演化自身策略、技能與工作流程的方法。此方法確保了性能的單調安全性,避免了無防護自我演化方法中常見的效能倒退問題。

羅福莉在中關村AI巔峰論壇宣稱AGI已實現。AI發展的下一步是自進化。與楊植麟、張鵬共同討論。
OpenClaw 是一個在本機電腦運行的開源 AI 代理,以破紀錄速度衝上 GitHub 24 萬星,被稱為「數位員工」,能自動化任務、主動檢查及長期記憶。它透過聊天應用程式調用 Claude 和 GPT 等現有 LLM,ClawHub 社群湧現超過 13,000 個技能並具自我進化能力。中國政府與科技巨頭大力支持其採用,掀起巨大熱潮。

卡帕西開源Agent自進化訓練框架,實驗週期僅5分鐘。48小時內GitHub星標飆升至9.5k。下一步模擬整個博士社群。
一種無需訓練的雙循環對抗自演化框架解決了LLM角色扮演代理的越獄漏洞問題。它耦合了針對角色的攻擊者循環以產生更強越獄提示,以及角色扮演防禦者循環將失敗提煉成階層式安全知識庫。在推理時,它檢索結構化知識以確保保持角色同時安全的回應,超越基準在忠實度和抵抗力上。

Lily Weng 在最新部落格中提出,AI 的自進化應從 Harness 開始。DeepSeek 的崔添翼轉發並表示認同,認為該方向極易產出具體成果。

本研究分析了 LLM 代理如何透過提示詞、工具等外部 Harness 進行自我演化。研究發現,儘管不同等級的模型都能有效更新 Harness,但從這些更新中獲益的能力並非線性增長,中階模型反而表現出最強的獲益能力。