
Outcome Monitors 揭露工具的無聲故障
Outcome Monitors 會偵測違反預期結果契約的工具輸出,在保留結果的同時發出復原提示。在評估中,它讓 ToolMaze 的完成率提升超過一倍,並使 tau-bench 零售任務完成率提高最多 14 個百分點。
Tag: #tool-use32 results

Outcome Monitors 會偵測違反預期結果契約的工具輸出,在保留結果的同時發出復原提示。在評估中,它讓 ToolMaze 的完成率提升超過一倍,並使 tau-bench 零售任務完成率提高最多 14 個百分點。

FinSkillBench 是一套全新的基準測試,用於評估 AI 代理在投資組合建構、風險管理與基本面分析上的能力。在 9 個模型的測試中,精選程序技能將平均表現從 0.366 提升至 0.528,而代理自行生成的技能幾乎沒有帶來效益。

據報 Tencent 的 Hunyuan Hy4 已出現在 Yuanbao App 的模型選擇清單中,被標示為專家級模型,並具備工具使用能力。它的定位高於 Hy3,並與 DeepSeek 並列;此前 Tencent 曾表示,更大參數規模的 Hy4 將很快推出,並提升效能與多模態能力。

NVIDIA SkillEvaluator 用於衡量封裝後的 agent skills 是否能改善 AI agent 的表現。它評估指令、範例與工具指南的價值,協助 agent 找到相關上下文、減少無效步驟,更有效完成專業任務。

一名 Reddit 使用者表示,Qwen3.8-27B 僅憑登入憑證與大學名稱,就透過 80 次工具呼叫自主取得課表。另一項測試中,它下載並分析社群媒體影片、自行安裝 Whisper 進行轉錄,還強化影片畫面,全程無需人工介入。

Agentao 是一個以本機優先為核心的執行環境,將 LLM 產生的行動提案與主機授權的工具執行分離。它透過明確的權限、狀態管理、協定邊界與執行追蹤,讓使用工具的 Agent 更容易被檢查與控管。

這項研究提出一套可攜式記憶框架,將科學經驗儲存為可檢視的事實與可執行技能,供材料科學 AI 代理使用。在工具操作問題與模擬工作流程中,記憶讓 GPT-5.2 的任務成功率近乎翻倍,同時減少重複錯誤、工具呼叫與 token 成本。

ToolSense 是一個新的開源診斷框架,用於評估大型語言模型 (LLM) 從大型目錄中檢索和理解工具的能力。研究揭示了「知識與檢索脫節」的現象,即模型在檢索基準測試中表現良好,但卻無法展現對工具的實際理解。

Evoflux 是一種推理時演化搜尋方法,旨在修復小型語言模型的工具執行工作流。透過結構化編輯與執行回饋來演化工作流圖,顯著提升了工具執行的可行性。

Sci-PRM 是一種新型過程獎勵模型,旨在透過整合工具執行與邏輯驗證來提升科學推理能力。它利用 SCIPRM70K 資料集,針對工具選擇與結果解釋提供細粒度的監督,有效減少複雜科學領域中的幻覺問題。