📄ArXiv AI•較早收集於 3h
自我監控需結構整合

#metacognition#self-monitoring#rl-agentsmulti-timescale-agentsarxiv
💡附加元認知為何失效,但整合可恢復RL代理效能(d=0.62)。
⚡ 30-Second TL;DR
有什麼變化
附加自我監控崩潰為常數(信心std <0.006),不影響政策。
為什麼重要
強調無整合的輔助自我監控有害或無效,促使代理架構重新設計。可能將焦點從附加損失轉向嵌入路徑的元認知,以實現穩健RL。
下一步行動
將信心閘控探索整合至RL代理的政策路徑,用於非穩態環境。
誰應關注:Researchers & Academics
關鍵要點
- •附加自我監控崩潰為常數(信心std <0.006),不影響政策。
- •結構整合提升非穩態效能(Cohen's d=0.62, p=0.06)。
- •TSM-to-policy路徑貢獻最大收益;整體無優於無模組基準。
- •測試於1D/2D部分可觀測捕食者-獵物環境,高達50k步驟。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。