
狀態匹配蒸餾提升多輪代理效能
SMRC-SD 解決多輪代理在特權式 on-policy 蒸餾中的狀態與參考軌跡不匹配問題。它只在學生代理目前狀態符合參考軌跡時提供指導,並建立以該狀態為條件的教師上下文,使 Qwen3-1.7B 在 ALFWorld 的任務成功率從 0.746 提升至 0.865,在 WebShop 則從 0.574 提升至 0.693。
Tag: #agent-training10 results

SMRC-SD 解決多輪代理在特權式 on-policy 蒸餾中的狀態與參考軌跡不匹配問題。它只在學生代理目前狀態符合參考軌跡時提供指導,並建立以該狀態為條件的教師上下文,使 Qwen3-1.7B 在 ALFWorld 的任務成功率從 0.746 提升至 0.865,在 WebShop 則從 0.574 提升至 0.693。

Lobster提供訓練、評測、部署GUI智能體的一站式解決方案,可用於真實手機裝置。無需人工干預或預設腳本。這簡化了自主手機互動開發。

Apple 的 AutoPlay 可擴展合成任務生成,用於後訓練 MLLM 在電腦使用、網頁導航和機器人等代理領域。透過探索克服昂貴的人工註解和有限提示,生成多樣、可行、可驗證的任務。此方法大幅提升任務覆蓋率。

卡帕西開源Agent自進化訓練框架,實驗週期僅5分鐘。48小時內GitHub星標飆升至9.5k。下一步模擬整個博士社群。

Together AI 發布 CoderForge-Preview,這是用於訓練編碼代理的最大開放資料集。它包含 161K 個經過測試驗證的編碼代理軌跡,在 SWE-Bench Verified 上達到 59.4%。

港中文與美團研究人員開發了 Agent-RRM,一種獎勵模型,能評分整個 Agent 軌跡的推理品質與工具使用,而非僅看最終結果。他們整理了註解軌跡數據集,並建置 Reagent 框架,將文字反饋與分數整合進訓練。此舉解決多步驟任務如網路搜尋與程式碼撰寫中的稀疏獎勵問題。

Hugging Face 推出 ALTK-Evolve,這是一種用於 AI 代理的在職學習新技術。此方法讓代理能在真實任務中直接學習與適應。目標是提升代理效能,而無需完整重新訓練。

作者詳述在OpenClaw上建構11個足球啟發的AI代理,用於郵件篩選、領袖追蹤、論文分析和內容創作等任務。強調OpenClaw如「空白土地」,需透過聊天定義角色,而非UI。分享設定以啟發安裝後應用,使用GLM5和Kimi K2等模型。

一項研究顯示,AI 代理無法有效自學新技能,常導致效能惡化。人類策劃的技能則大幅提升代理能力。教導代理特定任務如資訊擷取效果良好。
AGB CLOUD提供安全沙盒,用於訓練理解螢幕及操作UI元素的多模態代理。同時支援文字、影像及網頁互動。