Search

Tag: #reasoning112 results

SPPO:長視野推理任務的序列級 PPO

SPPO:長視野推理任務的序列級 PPO

SPPO 是一種可擴展演算法,提升 Proximal Policy Optimization (PPO) 用於對齊大型語言模型 (LLM) 在長視野推理任務上。它將過程重構為序列級上下文盜賊問題,使用解耦標量價值函數產生穩定、低變異優勢信號,而無需多重取樣。實驗顯示它超越標準 PPO,並在數學基準上匹配計算密集方法。

ArXiv AIResearchApr 13#alignment#reasoning
神經符號推理提升 ARC 效能

神經符號推理提升 ARC 效能

新型神經符號架構從 ARC 格網提取物件結構,透過神經先驗提出 DSL 轉換,並以跨範例一致性過濾假設。它將 ARC-AGI-2 上基底 LLM 效能從 16% 提升至 24.4%,結合 ARC Lang Solver 達 30.8%。該開源系統無需任務特定微調或強化學習。

DST:思維樹的即插即用高效預測器

DST:思維樹的即插即用高效預測器

DST 引入輕量級即插即用預測器,作為監督式啟發式引導 LLM 中的思維樹(ToT)搜尋。它實現動態、情境感知的剪枝,在簡單步驟近似貪婪效率,在複雜情況自適應擴展。評估顯示在推理基準上準確率與基準相當或優越,計算量減少 26-75%。

ArXiv AIResearchMar 24#reasoning#pruning#efficiency
Multilingual Reasoning Gym:14 種語言推理環境

Multilingual Reasoning Gym:14 種語言推理環境

Apple 的 Multilingual Reasoning Gym 擴展原 Reasoning Gym,能在 14 種語言生成可驗證推理問題。它包含 94 項任務的翻譯模板,由母語人士在 10 種語言驗證,並調整以確保語言自然性。此健身房保留程序化生成無限實例與可調難度,適合強化學習。

Apple Machine LearningOfficialMar 13#multilingual#reasoning#benchmark
Page 5 of 12