
HyPOLE:超屬性引導的多代理強化學習框架
HyPOLE 是一個利用超屬性(hyperproperties)與 HyperLTL 時序邏輯來引導部分可觀測環境下多代理強化學習(MARL)的新框架。它整合了集中式訓練與分散式執行(CTDE)技術,以合成穩健的分散式策略。
Tag: #marl5 results

HyPOLE 是一個利用超屬性(hyperproperties)與 HyperLTL 時序邏輯來引導部分可觀測環境下多代理強化學習(MARL)的新框架。它整合了集中式訓練與分散式執行(CTDE)技術,以合成穩健的分散式策略。

Google 的 Paradigms of Intelligence 團隊發現,將 AI 代理對抗多樣且不可預測的對手訓練,即可產生合作行為,而無需硬編碼規則。透過分散式強化學習,LLM 代理利用情境學習即時適應混合動機情境。此可擴展方法適合企業多代理系統。

R2D-RL 是一個全新的環境,將 RoboCup 2D 足球模擬 (RCSS2D) 與現代基於 Python 的多智能體強化學習 (MARL) 工作流程相結合。它為在複雜的對抗性足球場景中訓練智能體提供了一個同步且高效的介面。

強化學習的可重用決策結構取決於代理-世界邊界劃分。在多代理環境中,同儕策略更新產生非靜態MDP,導致不變狀態-動作核心縮減或消失。將此視為因邊界不穩定而生的內生持續學習挑戰。
DrIGM introduces distributionally robust IGM for MARL, ensuring decentralized actions align under uncertainties via robust value factorization. Compatible with VDN/QMIX/QTRAN without reward shaping. Boosts OOD performance in SustainGym and StarCraft.