Search

Tag: #agent-training10 results

狀態匹配蒸餾提升多輪代理效能

狀態匹配蒸餾提升多輪代理效能

SMRC-SD 解決多輪代理在特權式 on-policy 蒸餾中的狀態與參考軌跡不匹配問題。它只在學生代理目前狀態符合參考軌跡時提供指導,並建立以該狀態為條件的教師上下文,使 Qwen3-1.7B 在 ALFWorld 的任務成功率從 0.746 提升至 0.865,在 WebShop 則從 0.574 提升至 0.693。

港中文聯合美團為Agent添加「過程分」

港中文聯合美團為Agent添加「過程分」

港中文與美團研究人員開發了 Agent-RRM,一種獎勵模型,能評分整個 Agent 軌跡的推理品質與工具使用,而非僅看最終結果。他們整理了註解軌跡數據集,並建置 Reagent 框架,將文字反饋與分數整合進訓練。此舉解決多步驟任務如網路搜尋與程式碼撰寫中的稀疏獎勵問題。

机器之心MediaFeb 20#reward-model#agent-training
OpenClaw上的夢幻11 AI代理

OpenClaw上的夢幻11 AI代理

作者詳述在OpenClaw上建構11個足球啟發的AI代理,用於郵件篩選、領袖追蹤、論文分析和內容創作等任務。強調OpenClaw如「空白土地」,需透過聊天定義角色,而非UI。分享設定以啟發安裝後應用,使用GLM5和Kimi K2等模型。