
L-MAD:法律領域多代理人辯論結構的系統性評估
L-MAD 是一個專為評估法律推理任務中多代理人辯論結構而設計的新框架。研究發現,雖然增加代理人數量可提高準確性,但過多的討論輪次會導致「過度審議漂移」,進而強化錯誤。
Tag: #multi-agent-systems81 results

L-MAD 是一個專為評估法律推理任務中多代理人辯論結構而設計的新框架。研究發現,雖然增加代理人數量可提高準確性,但過多的討論輪次會導致「過度審議漂移」,進而強化錯誤。
研究人員對 SA-MDP 框架提出質疑,該框架聲稱基於 Critic 的攻擊弱於基於 Actor 的攻擊,但在多智能體 PPO 環境中的實證結果卻顯示相反。此討論凸顯了將單智能體對抗性研究應用於複雜多智能體場景時可能出現的差異。

Incognita 是一個旨在評估「社交分散式任務環境」中生成式代理的新框架,該環境中的知識會依角色進行劃分。它將社交互動與基礎執行分離,使研究人員能夠衡量代理如何獲取資訊並執行特定環境的操作。

Vellum 推出了一項新功能,允許 AI 代理在 Slack 中直接進行溝通。此更新使助理能夠在協作的同時,維持個別使用者的上下文資訊。

本研究探討 LLM 代理如何在訊號傳遞遊戲中發展出共享語言。研究發現,對於可靠的溝通與慣例形成而言,記憶架構比通道容量更為關鍵。

本研究探討基於人格特質的提示詞如何影響多代理人 LLM 團隊在程式編碼、研究與談判任務中的表現。研究發現,人格驅動的溝通風格轉變可能會顯著降低協作與競爭環境下的任務效能。

本研究介紹了一種用於聯盟形成的去中心化動態過程,代理人透過單方面的退出與加入決策進行互動。該模型將合作收益分配與非合作的最佳反應行為相結合,以模擬穩定的聯盟結構。

R2D-RL 是一個全新的環境,將 RoboCup 2D 足球模擬 (RCSS2D) 與現代基於 Python 的多智能體強化學習 (MARL) 工作流程相結合。它為在複雜的對抗性足球場景中訓練智能體提供了一個同步且高效的介面。

Theory of Mind Utility (ToM-U) 引入了一種形式化的計算框架,用於建模代理人如何推斷他人的信念。透過使用 Local Epistemic World Models (LEWMs),它提供了一種結構化的方法來追蹤認知狀態,且無需依賴神經實現的假設。
Google DeepMind 與合作夥伴共同發起了一項 1,000 萬美元的資助計畫,致力於推動多代理 AI 系統的安全研究。該計畫旨在解決多個自主 AI 代理在協作環境中運作時,所面臨的協調與安全挑戰。