來源近期收集於 19h

研究鎖定 LLM Agent 的虛構工具呼叫

閱讀原文: ArXiv AI
#tool-calling#hallucination#agent-security

工具選擇防護無法阻擋不存在的工具呼叫;這篇論文提出缺失的第一道檢查。

30 秒速覽

有什麼變化

論文定義了五類工具幻覺分類法。

為什麼重要

研究指出一個許多 Agent 安全系統忽略的獨立可靠性層。開發者可能需要先驗證工具是否存在及其 Schema,再套用授權或政策閘控。

下一步行動

在每條工具呼叫 Agent 流程的授權閘控之前,加入封閉世界工具註冊表與嚴格簽章驗證器。

誰應關注:Developers & AI Engineers

關鍵要點

  • 論文定義了五類工具幻覺分類法。
  • 解析器在因果閘控前檢查工具是否存在及其呼叫簽章。
  • 原始 JSON 介面出現 34 次虛構工具呼叫,受約束介面則為 3 次。

深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

增強重點摘要

  • 模型規模無法消除工具幻覺:評測顯示 675B 參數的超大型模型其工具幻覺發生率,與 7B 至 8B 參數的小型模型相當。
  • 提出免微調的「解析階梯」(Resolution Rung)架構,在下游因果閘控或調度層之前執行註冊表成員資格與簽名校驗。
  • 定義了閉環解析器無法捕捉的單一不可約殘差(Irreducible Residue)——「借用參數」(Borrowed Arguments),即參數結構完全符合 Schema 卻來自其他錯誤上下文。
  • 針對 Model Context Protocol (MCP) 多伺服器架構,研究定義了命名空間遮蔽與命名衝突引發的 5 種次級失敗模式(M1–M5)。
  • 在即時 MCP 測試環境中記錄到 154 次幻覺,並開源了用於系統性評測解析器與驗證器的工具幻覺基準測試集(HTB)。

技術深入

  • 架構設計(Resolution Rung):一種輕量級、無需重新訓練或微調的閉環解析器,嚴格部署於因果閘控(Causal Gating)與執行分發層之前,先行驗證工具註冊表成員資格(Registry Membership)與呼叫簽名。
  • 五類工具幻覺分類法(H1–H5):系統化涵蓋完全虛構的工具端點、不匹配的函式簽名、無效的參數架構以及虛構的參數名稱等失敗模式。
  • MCP 多伺服器失敗分類法(M1–M5):針對 Model Context Protocol 將多個獨立工具伺服器合併至單一命名空間時,分析命名空間遮蔽(Namespace Shadowing)與名稱衝突引發的五類系統性錯誤。
  • 邊界限制(借用參數):形式化定義解析器的檢測盲區,當 Agent 傳入跨工具或跨上下文但結構完全符合 Schema 的有效參數時,靜態解析器無法識別其語意錯誤。
  • 診斷工具(HTB 基準):釋出具版本控制的 Hallucinated-Tools Benchmark,用於量化測試各類基礎模型與防禦架構在受約束及非受約束介面下的工具幻覺防禦表現。

前景展望基於引用來源的 AI 分析

單靠擴展模型參數量無法解決 Agent 工具呼叫的幻覺脆弱性
評測證實 675B 模型與 7B 模型的工具幻覺發生率相當,顯示該問題源於架構與介面設計而非參數量不足。
MCP 等多伺服器工具整合架構必須引入強制命名空間隔離機制
多伺服器合併引發的 M1–M5 命名衝突與 154 次即時幻覺,證明現行扁平化命名空間難以支撐大型多 Agent 系統的穩定運作。

時間線

2026-09
Laxmipriya Ganesh Iyer 於 arXiv 發布論文與 HTB 基準,提出解析階梯架構與 H1-H5 工具幻覺分類法

來源 (7)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。