📄ArXiv AI•較早收集於 40m
DivInit:透過多樣化查詢初始化提升 Agentic Search 效能

💡學習如何透過簡單的查詢多樣化技巧,在無需訓練的情況下將 Agentic Search 準確度提升 5-7 個百分點。
⚡ 30-Second TL;DR
有什麼變化
標準的平行採樣在第一輪查詢時容易產生冗餘。
為什麼重要
此方法為提升 Agentic Search 準確度提供了一種具成本效益的途徑,且無需額外的模型訓練。對於開發基於 RAG 的代理系統的開發者而言,這是一項實用的優化方案。
下一步行動
將 DivInit 整合至您的 Agentic Search 流程中,透過實作基於多樣性的初始查詢選擇步驟,以減少檢索重疊。
誰應關注:Researchers & Academics
關鍵要點
- •標準的平行採樣在第一輪查詢時容易產生冗餘。
- •DivInit 透過產生 n 個候選查詢並選取 k 個多樣化種子來執行平行軌跡。
- •在相同運算資源下,多跳問答基準測試提升了 5 到 7 個百分點。
- •無需訓練的特性使其能與現有的開源模型相容。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
- •代理式搜尋中,標準的平行採樣方法普遍存在冗餘問題,因為自動生成的多個子查詢經常導致檢索到語義高度相似的內容,進而浪費大型語言模型(LLM)的token並限制了視角多樣性。
- •查詢多樣化技術,例如在代理式推薦系統中利用熵(entropy)引導的偏好探詢,能夠有效處理模糊的用戶查詢,減少不必要的互動和查詢疲勞,避免因過早收斂搜尋空間而導致的過度自信推薦。
- •與傳統的檢索增強生成(RAG)系統採用固定、單次檢索管道不同,DivInit 所優化的代理式搜尋系統賦予LLM代理動態控制檢索過程的能力,包括決定何時搜尋、如何制定查詢以及評估結果是否足夠。
- •查詢多樣性的有效性可以透過「上下文驅動術語採納率」(Context-driven Term Adoption Rate, CTAR)等指標進行量化,該指標衡量新引入的查詢術語是否可追溯到先前檢索到的證據,突顯了代理式搜尋中跨步驟證據重用的重要性。
📊 競品分析▸ Show
| 特性/產品 | DivInit | 標準平行採樣 | 傳統RAG | EfficientRAG | AgentInit | 多元化搜尋 (bigdata.com) |
|---|---|---|---|---|---|---|
| 訓練需求 | 無需訓練 | 無需訓練 (但效率低) | 通常無需訓練 (檢索部分) | 需要LLM合成訓練數據 (用於Labeler和Filter) | 涉及多輪互動與反思 | 專有管道,細節未公開 |
| 查詢多樣性機制 | 從單次模型呼叫中選取k個多樣化種子 | 生成多個子查詢,但常導致同質性 | 單次檢索,不側重查詢多樣性 | 迭代生成新查詢,無需每次LLM呼叫 | 使用Pareto原則平衡多樣性與任務相關性 | 智慧平衡多來源和視角,消除單一來源偏見和語義冗餘 |
| 冗餘處理 | 減少檢索冗餘 | 容易產生冗餘 | 未明確設計 | 過濾不相關資訊 | 旨在提高協作效率,減少冗餘工作 | 主動消除語義冗餘 |
| 多跳問答效能提升 | 提升5-7個百分點 | 可能因冗餘而受限 | 複雜多跳問題可能失敗 | 在三個數據集上超越現有RAG方法 | 提升整體系統效能 | 改善代理上下文,間接提升QA效能 |
| 運算成本 | 在相同運算資源下提升效能,減少冗餘 | 增加延遲和計算成本 | 通常較低 (單次檢索) | 時間效率提升60-80% | 顯著減少token消耗 | 智慧化處理,避免蠻力導致的高成本 |
| 應用範圍 | 代理式搜尋、多跳問答 | 通用查詢擴展 | 通用知識密集型任務 | 多跳問答 | 基於LLM的多代理系統初始化 | AI代理和RAG管道 |
🛠️ 技術深入
- DivInit 的核心機制是從單次模型呼叫中生成 'n' 個候選查詢,然後透過一個選擇過程挑選出 'k' 個具有高度多樣性的種子查詢,以啟動平行軌跡。
- 這種多樣化選擇機制可能借鑒了資訊理論方法,例如熵(entropy),來量化候選查詢之間的不確定性或資訊增益,以確保選出的種子查詢能夠最大化探索空間並有效減少語義冗餘。
- 其「無需訓練」的特性表明該方法不涉及模型參數的微調,而是依賴於現有大型語言模型生成多樣化查詢的能力,並結合一個獨立的演算法來實現多樣性選擇。
- 透過減少檢索冗餘,DivInit 有助於優化LLM的token使用效率,避免在處理重複或高度相似的上下文上浪費計算資源,從而提高整體效率。
🔮 前景展望AI analysis grounded in cited sources
提升代理式搜尋系統的適應性和魯棒性。
透過多樣化初始查詢,系統能更有效地探索資訊空間,減少因單一視角造成的資訊盲點或偏見,從而更好地應對複雜和模糊的查詢。
降低多跳問答任務的運算資源消耗。
減少檢索冗餘意味著處理更少重複或不相關的資訊,這可以優化LLM的token使用效率,並可能減少後續推理步驟的負擔。
促進無需訓練的優化技術在AI代理中的應用。
DivInit的無需訓練特性降低了部署門檻,使其能與多種現有開源模型兼容,加速了此類優化方法在實際應用中的普及。
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。