Search

Tag: #llm-agents89 results

EVOM:執行驗證強化學習優化建模

EVOM:執行驗證強化學習優化建模

EVOM 是一種使用執行驗證強化學習自動化 LLM 優化建模的新框架。它將 Gurobi 等求解器視為互動驗證器,生成程式碼、在沙箱中執行,並使用結果作為純量獎勵,透過 GRPO/DAPO 優化。它超越過程監督 SFT,支持 Gurobi、OR-Tools 和 COPT 的零樣本求解器轉移。

ArXiv AIResearchApr 2#llm-agents
NextMem:LLM 代理的潛在事實記憶

NextMem:LLM 代理的潛在事實記憶

NextMem 是用於 LLM 代理的潛在事實記憶框架,利用自回歸自編碼器實現高效記憶建構與精準重建。它採用兩階段訓練流程,包括自回歸重建對齊與漸進潛在替換,並加入量化以降低儲存開銷。實驗顯示其在檢索、穩健性與擴展性上表現優異;程式碼已在 GitHub 開源。

LLM 網頁代理規劃框架

LLM 網頁代理規劃框架

這篇 arXiv 論文提出用於基於 LLM 的網頁代理的正式 AI 規劃框架,將架構對應到經典搜尋範式如 BFS、DFS。它提出五個新指標評估軌跡品質,以及 794 個 WebArena 人工標註軌跡資料集。結果顯示 Step-by-Step 代理更貼近人類路徑,而 Full-Plan 代理在準確度上出色。

A-MAC:LLM 代理的智慧記憶控制

A-MAC:LLM 代理的智慧記憶控制

A-MAC 是 LLM 代理適應性記憶錄取的新框架,解決無法控制保留無關或幻覺資料的問題。它透過五個因素評估記憶:未來效用、事實信心、語義新穎性、時間新近性及內容類型先驗。在 LoCoMo 基準測試中,F1 分數達 0.583,並比最先進系統降低 31% 延遲。

Mozi:藥物發現LLM代理的治理自治

Mozi:藥物發現LLM代理的治理自治

Mozi 提出雙層架構,用於藥物發現的 LLM 代理,控制平面強制治理工具使用與反思式重新規劃,工作流程平面將標準藥物階段結構化為可組合技能圖。整合資料合約與人機互動檢查點,確保高風險管線的可靠性。在 PharmaBench 評估顯示優異準確度,案例研究證實有效導航化學空間與毒性篩選。

Page 5 of 9