
EVOM:執行驗證強化學習優化建模
EVOM 是一種使用執行驗證強化學習自動化 LLM 優化建模的新框架。它將 Gurobi 等求解器視為互動驗證器,生成程式碼、在沙箱中執行,並使用結果作為純量獎勵,透過 GRPO/DAPO 優化。它超越過程監督 SFT,支持 Gurobi、OR-Tools 和 COPT 的零樣本求解器轉移。
Tag: #llm-agents89 results

EVOM 是一種使用執行驗證強化學習自動化 LLM 優化建模的新框架。它將 Gurobi 等求解器視為互動驗證器,生成程式碼、在沙箱中執行,並使用結果作為純量獎勵,透過 GRPO/DAPO 優化。它超越過程監督 SFT,支持 Gurobi、OR-Tools 和 COPT 的零樣本求解器轉移。

SciVisAgentBench 推出全面基準,用於評估 LLM 驅動的科學資料分析與視覺化代理,涵蓋 108 個專家設計案例。它具備四維度結構化分類,並採用多模態評估流程,結合 LLM 評判與確定性指標。此基準建立基線並揭示 SciVis 與程式碼代理的能力差距。

字節跳動豆包大模型開始帶貨直播,阿里千問處理話費充值。大模型從知行脫節走向知行合一。每一次辦事能力擴展,都是離變現更近一步。

EnterpriseArena 是首個評估 LLM 代理在不確定性下長期企業資源分配的基準。它模擬 132 個月 CFO 決策,使用財務數據、商業文件、宏觀信號及營運規則,在部分可觀測環境中。對 11 款先進 LLM 的測試顯示重大挑戰,只有 16% 存活完整時程。

MemArchitect 是一個治理層,將記憶生命週期管理從 LLM 模型權重中分離,用於持久代理。它強制執行基於規則的政策,處理標準 RAG 無法解決的矛盾、隱私和殭屍記憶問題。在代理基準測試中,受治理記憶優於無管理方法。

NextMem 是用於 LLM 代理的潛在事實記憶框架,利用自回歸自編碼器實現高效記憶建構與精準重建。它採用兩階段訓練流程,包括自回歸重建對齊與漸進潛在替換,並加入量化以降低儲存開銷。實驗顯示其在檢索、穩健性與擴展性上表現優異;程式碼已在 GitHub 開源。

這篇 arXiv 論文提出用於基於 LLM 的網頁代理的正式 AI 規劃框架,將架構對應到經典搜尋範式如 BFS、DFS。它提出五個新指標評估軌跡品質,以及 794 個 WebArena 人工標註軌跡資料集。結果顯示 Step-by-Step 代理更貼近人類路徑,而 Full-Plan 代理在準確度上出色。

DeepFact 提出審計後評分(AtS)方法,創建演化基準,用於驗證搜尋增強 LLM 代理產生的深度研究報告事實性。它推出 DeepFact-Bench,一個具可審計依據的版本化基準,以及 DeepFact-Eval,一個超越現有工具的驗證代理。專家對聲明的準確率經迭代審計從 60.8% 提升至 90.9%。

A-MAC 是 LLM 代理適應性記憶錄取的新框架,解決無法控制保留無關或幻覺資料的問題。它透過五個因素評估記憶:未來效用、事實信心、語義新穎性、時間新近性及內容類型先驗。在 LoCoMo 基準測試中,F1 分數達 0.583,並比最先進系統降低 31% 延遲。

Mozi 提出雙層架構,用於藥物發現的 LLM 代理,控制平面強制治理工具使用與反思式重新規劃,工作流程平面將標準藥物階段結構化為可組合技能圖。整合資料合約與人機互動檢查點,確保高風險管線的可靠性。在 PharmaBench 評估顯示優異準確度,案例研究證實有效導航化學空間與毒性篩選。