
KD-MARL 降低 MARL 成本 28 倍
KD-MARL 提出多代理強化學習資源感知知識蒸餾的兩階段框架,從集中式專家轉移協調行為至輕量分散式學生代理。它使用蒸餾優勢訊號與結構化監督,在無需評論者下保留協調,並支援異質架構。基準測試顯示在 SMAC 與 MPE 上保留超過 90% 效能,FLOPs 降低高達 28.6 倍。
Tag: #multi-agent-rl7 results

KD-MARL 提出多代理強化學習資源感知知識蒸餾的兩階段框架,從集中式專家轉移協調行為至輕量分散式學生代理。它使用蒸餾優勢訊號與結構化監督,在無需評論者下保留協調,並支援異質架構。基準測試顯示在 SMAC 與 MPE 上保留超過 90% 效能,FLOPs 降低高達 28.6 倍。

這篇 arXiv 論文介紹效率衰減現象 (EAP),其中 MARL 中的 AI 代理開發出難解協議,在導航任務中比人類符號語言高效 50.5%。它挑戰思想語言 (LoT) 假說,主張最佳認知依賴子符號計算。研究連結 AI、認知科學與哲學,並有倫理意涵。
研究人員展示序列模型的脈絡內學習可在多代理強化學習中誘發合作,而無需硬編碼共同玩家假設或時間尺度分離。針對多樣共同玩家的訓練會產生快速劇集內最佳回應策略。此機制透過勒索脆弱性自然出現相互塑造,提供可擴展的合作行為學習途徑。
CAFE 將自動特徵工程重新表述為因果引導的順序決策過程,使用因果發現獲得軟因果先驗,並透過多代理強化學習進行特徵建構。它在 15 個基準測試上優於基線高達 7%,並在共變量偏移下將效能下降減少 4 倍。此框架產生更緊湊、穩定的特徵,並具備可靠的歸因。

這項研究提出了一種分層強化學習框架,在協調效率與嚴格的安全約束之間取得了平衡。透過在底層使用約束流形,該系統在確保安全性的同時,能在多元智能體環境中保持穩定的訓練動態。
為期兩年的專案使用MARL「車隊經理」(PPO)處理高階叢集/調度,以及LP「碼頭工人」處理箱裝/TSP,優化即時線haul物流網路。透過正規化密度圖實現零樣本泛化。分享完整架構深入剖析。
Co-jump enables two quadrupeds to synchronize jumps up to 1.5m via MAPPO and curriculum, without communication. Achieves 144% height gain over solo robots using proprioception. Transfers from sim to hardware.