📄較早收集於 11h

In2AI 在多智能體策略互動中達到 SOTA 水準

In2AI 在多智能體策略互動中達到 SOTA 水準
PostLinkedIn
📄閱讀原文: ArXiv AI

💡8B 模型利用創新的多智能體強化學習獎勵歸因方法,在策略遊戲中擊敗了 GPT-5。

⚡ 30-Second TL;DR

有什麼變化

引入了具有資格門控的延遲每步獎勵歸因技術,實現穩定的強化學習訓練。

為什麼重要

這項研究為訓練更小、更高效的模型以處理複雜的多智能體環境提供了可擴展的框架,有望減少在策略任務中對大型專有模型的依賴。

下一步行動

在您的多智能體強化學習管道中實作延遲獎勵歸因技術,以提升訓練穩定性與樣本效率。

誰應關注:Researchers & Academics

關鍵要點

  • 引入了具有資格門控的延遲每步獎勵歸因技術,實現穩定的強化學習訓練。
  • 利用 vLLM 連續批次處理與基於課程的對手採樣來提升效率。
  • 在 NeurIPS 2025 MindGames Arena 的開放與高效組別中均獲得第一名。
  • 在多智能體策略對戰中表現超越包含 GPT-5 在內的大型專有模型。

🧠 深度解析

Web-grounded analysis with 25 cited sources.

🔑 增強重點摘要

  • In2AI是一家成立於2020年的西班牙公司,專注於提供人工智慧諮詢與解決方案,其業務範圍涵蓋自然語言處理和機器視覺等領域,不僅限於多智能體強化學習。
  • In2AI的「具有資格門控的延遲每步獎勵歸因」技術,旨在解決多智能體強化學習中長期任務的稀疏和延遲獎勵問題,透過將最終獎勵分解為反映每個步驟增量進度的貢獻來提供更細緻的指導。
  • MindGames Arena是NeurIPS 2025舉辦的一項挑戰賽,專注於大型語言模型(LLM)智能體的「心智理論挑戰」,評估智能體在Mafia、Colonel Blotto和Codenames等遊戲中的協作與競爭策略能力。
  • In2AI解決方案中利用的vLLM連續批次處理技術,結合了PagedAttention機制,顯著提升了LLM推理的吞吐量並降低了延遲,其原理是透過高效管理KV快取記憶體和動態批次處理請求。
  • 課程式對手採樣是多智能體強化學習中的一種訓練策略,透過讓智能體與難度逐漸增加或多樣化的對手進行訓練,以提高學習的穩定性和泛化能力,避免對固定策略過度擬合。
📊 競品分析▸ Show
特性/基準In2AI 解決方案GPT-5 (OpenAI)GPT-5.5 (OpenAI)
模型規模8B 參數模型大型專有模型 (具備大規模參數)大型專有模型 (具備大規模參數)
多智能體策略互動在MindGames Arena基準測試中達到SOTA水準,超越GPT-5具備強大的代理智能與工具使用能力 (Toolformer 2.0),在AgentBench 2025基準測試中任務完成率高出37%專為代理任務優化,在持續任務執行、工具協調和多智能體協調方面表現更佳,優於GPT-5
核心技術延遲每步獎勵歸因、資格門控、vLLM連續批次處理、課程式對手採樣邏輯推理、持續注意力、上下文保留、工具調用API (Toolformer 2.0)專為代理性能調整,優化規劃、行動、觀察結果和持續執行
效率8B參數模型實現高效能,暗示高效率透過實時路由器和多模型混合系統實現資源優化針對代理任務提供顯著的成本降低和接近全模型的性能
基準測試NeurIPS 2025 MindGames Arena開放與高效組別雙料冠軍在ARC-AGI和Abstraction & Reasoning Challenge上達到約63%在SWE-Bench Pro上GPT-5.4 mini接近GPT-5.4 (54.4% vs 57.7%),工具調用準確度顯著提升

🛠️ 技術深入

  • 延遲每步獎勵歸因與資格門控 (Delayed Per-Step Reward Attribution with Qualified Gating):該技術旨在解決多智能體強化學習中常見的稀疏和延遲獎勵問題。它透過訓練一個「進度估計器」來量化每個步驟對整體任務完成的增量貢獻,從而將最終獎勵分解為更細粒度的每步貢獻。資格門控機制可能用於過濾或調節這些歸因,以確保訓練的穩定性,並將估計的每步貢獻與環境中執行的動作的基礎信號結合,作為有效的中間獎勵。
  • vLLM 連續批次處理 (vLLM Continuous Batching):這是一種用於大型語言模型推理的優化技術,透過在每次前向傳播後動態地將新請求添加到正在運行的批次中,從而最大化GPU利用率。它與PagedAttention系統協同工作,後者透過將KV快取記憶體塊按需分頁到非連續的GPU記憶體物理塊中,有效管理KV快取記憶體,顯著提高吞吐量並減少延遲。
  • 課程式對手採樣 (Curriculum-Based Opponent Sampling):此策略透過在訓練過程中動態調整對手的難度或類型,以防止智能體對固定策略過度擬合,並提高其泛化能力和學習穩定性。這可以涉及使用遺傳演算法來生成最佳訓練場景,或根據智能體的實時表現調整任務難度。
  • 8B 參數模型 (8B Parameter Model):In2AI的解決方案採用了一個80億參數的模型,這表明其在相對較小的模型規模下實現了卓越的性能,與通常數千億參數的大型專有模型形成對比,突顯了其架構和訓練方法的效率。

🔮 前景展望AI analysis grounded in cited sources

小型模型在特定AI任務中將能與大型模型競爭甚至超越。
In2AI的8B參數模型在MindGames Arena中超越了GPT-5等大型模型,表明針對特定任務優化的較小模型可以實現卓越性能,挑戰「越大越好」的趨勢。
多智能體強化學習的訓練效率將大幅提升。
延遲每步獎勵歸因技術、vLLM連續批次處理和課程式對手採樣等創新,將顯著減少訓練時間和計算資源,加速多智能體系統的發展與部署。
AI代理在複雜策略互動中的應用將更加廣泛。
In2AI在MindGames Arena等基準測試中展現的SOTA能力,預示著AI代理在需要複雜協調、欺騙檢測和戰略推理的真實世界場景(如自動駕駛、資源管理、人機協作)中將有更強大的表現。

時間線

2020
In2AI公司成立,專注於人工智慧諮詢與解決方案。
2025-07-07
NeurIPS 2025 MindGames Arena競賽開放,旨在挑戰LLM智能體的心智理論能力。
2025-10-15
NeurIPS 2025 MindGames Arena競賽結果公佈,In2AI在開放與高效組別中均獲得第一名。
2025-12
In2AI在NeurIPS 2025研討會上展示其獲獎解決方案。
2026-05-27
關於In2AI解決方案的論文《MindGames Arena Generalization Track: In2AI Solution with Delayed Per-Step Reward Attribution》在arXiv上發布。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI