📄最新收集於 9h

Iris 搜尋代理攀上開源模型新高峰

Iris 搜尋代理攀上開源模型新高峰
PostLinkedIn
📄閱讀原文: ArXiv AI
#multi-hop-search#sft-rl#context-management#web-agentsirisirisiris-miniiris-probrowsecompdeepsearchqa

💡了解 SFT-RL 與上下文管理如何讓開源搜尋代理在多項基準測試中取得領先。

⚡ 30-Second TL;DR

有什麼變化

Iris-mini 與 Iris-pro 分別以 35B-A3B 和 397B-A17B 規模訓練。

為什麼重要

Iris 顯示,搜尋代理的表現高度取決於訓練資料設計與推論時的上下文管理,而不只是基礎模型規模。若團隊如期釋出權重與完整配方,開發者將能重現或改造一個強大的開源多跳網路研究基線。

下一步行動

先在 BrowseComp 或 DeepSearchQA 重現 Iris 的評估設定,比較 ReAct 代理啟用與停用推論時上下文管理的差異,再調整模型或工具堆疊。

誰應關注:Researchers & Academics

關鍵要點

  • Iris-mini 與 Iris-pro 分別以 35B-A3B 和 397B-A17B 規模訓練。
  • 訓練資料從網頁超連結反向建構多跳實體圖問題,避免透過字串比對直接解題。
  • SFT-RL climbing 流程交替進行監督式微調與針對即時搜尋的強化學習。
  • 啟用上下文管理後,模型在 BrowseComp 最高達 88.6 分、DeepSearchQA 達 92.9 分、HLE 達 56.4 分。
  • 團隊計畫釋出模型權重,以及完整的資料建構、訓練與評估配方。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。