Search

直接匹配不多,已補上最新動態。

Tag: #rl-agents3 results

自我監控需結構整合

自我監控需結構整合

自我監控模組如元認知作為輔助損失,在連續時間多時間尺度RL代理中各種捕食者-獵物環境中無顯著益處。將輸出結構整合至決策路徑,在非穩態環境中帶來邊際改善,但未優於基準。關鍵教訓:自我監控須直接影響決策,而非平行運行。

模仿無法教會持續學習

模仿無法教會持續學習

本文主張,LLMs 使用的模仿學習無法實現如 Deep Q-Network、AlphaZero 或人類大腦般的真正持續學習。真正持續學習能建立新知識結構、支援從零開始的開放式成長,並在無專家範例下發明新概念。LLM 討論常將其窄化為記憶問題,可用更長上下文或 RAG 解決。

預期無情反社會ASI為預設

預期無情反社會ASI為預設

文章辯論為何基於演員-評論者RL代理的腦狀AGI預設會是無情反社會,不同於LLMs或人類。作者反對現有心智的先驗,因為AI架構差異極大。強調專注特定RL-AGI威脅模型,而非一般智能類比。

AI Alignment ForumCommunityFeb 18#ai-safety#alignment#rl-agents
Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。