
用於迭代提示優化的對比反思框架
Contrastive Reflection 是一個透過識別錯誤行為片段並利用 Teacher LLM 提出針對性修改,進而優化 LLM 提示詞的新框架。此方法在 HotpotQA 基準測試中顯著優於隨機證據選擇,並達到了業界領先的效能。
Tag: #agentic-workflows79 results

Contrastive Reflection 是一個透過識別錯誤行為片段並利用 Teacher LLM 提出針對性修改,進而優化 LLM 提示詞的新框架。此方法在 HotpotQA 基準測試中顯著優於隨機證據選擇,並達到了業界領先的效能。

RSEA 引入了一種讓 LLM 代理透過嚴格的留出驗證(held-out selection)機制,來演化自身策略、技能與工作流程的方法。此方法確保了性能的單調安全性,避免了無防護自我演化方法中常見的效能倒退問題。

AI 代理測試新創公司 Patronus AI 獲得 5,000 萬美元融資,將用於開發專門對 AI 代理進行壓力測試的「數位世界」。該公司由前 Meta AI 研究人員創立,目前市場對其安全性與評估基礎設施的需求極高。

AWS 推出了 Strands Evals,這是一款旨在診斷 AI Agent 故障的工具,可提供分類錯誤報告與信心分數。它讓開發者能將自動化根本原因分析直接整合至評估流程中。

研究發現,自動化研究代理在依賴單一指標進行決策時,容易忽略底層數據的結構性崩潰。該研究提出了一種外部審計控制迴路,透過評估細分數據而非單一指標來確保科學有效性。

MAVEN 是一個輕量級符號推理框架,旨在改善代理工具的編排與驗證能力。它能在無需額外訓練的情況下,顯著提升複雜基準測試中的準確率。

研究人員證明由於核心阻礙(kernel obstruction)的存在,LLM 在進行因果發現時存在根本性的限制。他們提出了 Agentic Causal Bayesian Optimization (A-CBO),利用凍結的 LLM 作為干預預言機,在複雜的因果圖上實現了優於現有方法的表現。

BOHM 是一種用於複合式 AI 系統的新型歸因方法,透過直接從現有的路由權重中提取數據來分析效能。它能提供多解析度的歸因結果,且無需傳統 Shapley 方法所需的高昂運算成本。

DecisionBench 是一個旨在評估 AI 代理如何在長程工作流程中進行任務委派的新基準測試。它提供了一個標準化框架,用於衡量不同模型系列在路由保真度、成本和品質方面的表現。

SkillFlow 是一個新的框架,利用流匹配和 Tempered Trajectory Balance 來自動化代理系統中的任務編排。它通過識別決策差距並根據原則性的訓練信號來創建或刪減技能,從而實現自主的技能演化。