📄ArXiv AI•最新收集於 9h
Iris 搜尋代理攀上開源模型新高峰

#multi-hop-search#sft-rl#context-management#web-agentsirisirisiris-miniiris-probrowsecompdeepsearchqa
💡了解 SFT-RL 與上下文管理如何讓開源搜尋代理在多項基準測試中取得領先。
⚡ 30-Second TL;DR
有什麼變化
Iris-mini 與 Iris-pro 分別以 35B-A3B 和 397B-A17B 規模訓練。
為什麼重要
Iris 顯示,搜尋代理的表現高度取決於訓練資料設計與推論時的上下文管理,而不只是基礎模型規模。若團隊如期釋出權重與完整配方,開發者將能重現或改造一個強大的開源多跳網路研究基線。
下一步行動
先在 BrowseComp 或 DeepSearchQA 重現 Iris 的評估設定,比較 ReAct 代理啟用與停用推論時上下文管理的差異,再調整模型或工具堆疊。
誰應關注:Researchers & Academics
關鍵要點
- •Iris-mini 與 Iris-pro 分別以 35B-A3B 和 397B-A17B 規模訓練。
- •訓練資料從網頁超連結反向建構多跳實體圖問題,避免透過字串比對直接解題。
- •SFT-RL climbing 流程交替進行監督式微調與針對即時搜尋的強化學習。
- •啟用上下文管理後,模型在 BrowseComp 最高達 88.6 分、DeepSearchQA 達 92.9 分、HLE 達 56.4 分。
- •團隊計畫釋出模型權重,以及完整的資料建構、訓練與評估配方。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。