📄ArXiv AI•近期收集於 23h
NTEP 獎勵更智慧的視覺語言工具使用

#agentic-vlm#tool-use#multimodal-reasoning#reward-modelingntep-8bntep-rntep-8bvision-language models
💡了解證據感知獎勵如何減少冗餘呼叫並提升代理式 VLM 的工具使用效果。
⚡ 30-Second TL;DR
有什麼變化
NTEP 標註會指出每個查詢所需的關鍵外部證據與必要工具呼叫。
為什麼重要
這項研究可透過減少無效工具呼叫並改善證據擷取,讓代理式 VLM 更具成本效益且更可靠。它也為開發者訓練處理複雜圖像任務的多模態代理提供了實用的監督方法。
下一步行動
為你的多模態代理建立 NTEP 式追蹤原型,替每次工具呼叫標註預期證據,並檢查回傳觀察是否滿足該目標。
誰應關注:Researchers & Academics
關鍵要點
- •NTEP 標註會指出每個查詢所需的關鍵外部證據與必要工具呼叫。
- •NTEP-R 會獎勵與證據搜尋目標一致的呼叫前意圖,以及與必要證據一致的呼叫後摘要。
- •非重複目標正則化項會懲罰重新探索已完成目標的冗餘呼叫。
- •NTEP-8B 在結合圖像裁切、圖像搜尋與文字搜尋的統一框架中,提升搜尋準確率與工具使用效率。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。