
反思推理提升臨床資料提取
提出深度反思推理,一種LLM代理框架,迭代自我批判並修訂臨床筆記的結構化輸出以確保一致性。在三個腫瘤學任務評估中,將F1分數提升至0.911,準確率達0.948。實現可靠的數位健康ML應用資料集。
Tag: #llm-agents89 results

提出深度反思推理,一種LLM代理框架,迭代自我批判並修訂臨床筆記的結構化輸出以確保一致性。在三個腫瘤學任務評估中,將F1分數提升至0.911,準確率達0.948。實現可靠的數位健康ML應用資料集。

PowerLens 利用 LLM 的常識推理,彌補使用者活動與系統參數的語意差距,為 Android 提供安全個人化電源管理。多代理架構辨識 UI 語義產生政策,PDL 約束確保安全,並透過隱性回饋在 3-5 天內學習偏好。實驗達 81.7% 準確率,比原生 Android 節省 38.8% 能源。

EDM-ARS 是一個多代理系統,使用五個 LLM 驅動代理自動化端到端教育數據挖掘研究。它產生完整的 LaTeX 手稿,包括驗證的機器學習分析和 Semantic Scholar 引用。作為開源項目發布,包含架構細節及因果推斷等擴展路線圖。

GSI Agent 是一個框架,利用監督微調、來自市政文件的檢索增強生成,以及基於代理的推理管道,提升大型語言模型在綠色雨水基礎設施任務的表現。它引入了適用於真實檢查情境的新 GSI 資料集。實驗顯示,在 GSI 任務上 BLEU-4 分數從 0.090 提升至 0.307,同時一般知識表現保持穩定。

EMPA 是一個針對 LLM 對話代理的人格對齊同理心評估的過程導向框架,解決使用者狀態潛在、回饋稀疏等挑戰。它將真實互動提煉成可控情境,並使用多代理沙盒測試策略適應。軌跡依心理空間的方向對齊、累積影響與穩定性評分。

PANGAEA-GPT 是一個階層式多代理框架,用於地球科學數據檔案如 PANGAEA 的自主發現與分析,解決數據集未充分利用問題。它採用 Supervisor-Worker 拓撲,具備資料類型感知路由、沙盒程式碼執行及自我修正機制。在海洋學與生態學工作流程中展示,僅需最少人工介入。
研究人員推出AgriWorld,一個Python執行環境,提供地理空間查詢、遙感分析、作物模擬和農業預測器的統一工具。Agro-Reflective LLM代理透過執行-觀察-精煉迴圈進行多輪農業資料推理。新AgroBench基準測試顯示,其表現優於純文字和直接工具使用基線。

JobAssist 是一個旨在協助求職者應對現代求職複雜性的平台。它為履歷客製化、求職信生成與申請追蹤等任務提供結構化管理。
TSR introduces trajectory-search rollouts to enhance multi-turn reinforcement learning for LLM agents. It uses lightweight tree-style search for high-quality trajectories, improving rollout generation and stabilizing training. Achieves up to 15% performance gains on tasks like Sokoban and WebShop.
INTENT is an inference-time planner for budget-constrained LLM agents using costly tools. Leverages hierarchical world model for intention-aware cost anticipation. Outperforms baselines on StableToolBench under budgets and price shifts.