
MARL Boundary Drift Causes Continual Learning Woes
Reusable RL decision structures depend on agent-world boundary. In multi-agent settings, peer policy updates create non-stationary MDPs, shrinking invariant state-action cores. Frames this as endogenous continual RL challenge from boundary instability.






