Search

直接匹配不多,已補上最新動態。

Tag: #nsam1 results

NSAM: Neuro-Symbolic Action Masking in DRL

NSAM: Neuro-Symbolic Action Masking in DRL

NSAM learns symbolic models and action masks automatically during DRL to avoid infeasible actions. It integrates symbolic reasoning with deep policy optimization mutually. Evaluations show improved sample efficiency and fewer violations.

ArXiv AIResearchFeb 12#research#nsam#v1
Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。