
強化學習讓滑動視窗注意力機制在數學推理中更具競爭力
SWARR 提出了一種結合監督式微調與強化學習的兩階段方法,旨在將滑動視窗注意力機制應用於複雜的數學推理。此方法有效縮小了線性複雜度模型與標準自注意力模型之間的效能差距。
Tag: #math-reasoning7 results

SWARR 提出了一種結合監督式微調與強化學習的兩階段方法,旨在將滑動視窗注意力機制應用於複雜的數學推理。此方法有效縮小了線性複雜度模型與標準自注意力模型之間的效能差距。

菲爾茲獎得主陶哲軒測試 ChatGPT 5.5 Pro,17 分鐘內產生論文級數學成果,數學專業岌岌可危。陶哲軒指出,「消化」AI 輸出仍屬人類工作。

ProofSketcher 提出混合管道,讓 LLM 在緊湊 DSL 中產生類型化證明草圖,用於數學/邏輯推理。輕量信任核心將草圖擴展為明確證明義務,以進行嚴格驗證。此方法結合 LLM 的說服力與 Lean 和 Coq 等定理證明器的可靠性,避免完整形式化。

Apple 推出「建構性電路放大」方法,透過針對 LLM 中的稀疏子網路(稱為電路)來提升數學推理能力。此方法基於既有電路負責特定任務,且微調會強化這些電路的發現。該方法識別關鍵權杖以進行精準、任務導向的更新。
SELFCEST 透過代理強化學習,讓基礎語言模型能在並行上下文中生成相同權重的克隆。訓練採用端到端方式,使用全域任務獎勵與共享參數 rollout 來分配分支預算。這在數學推理與長上下文 QA 基準上改善準確度-成本帕雷托前沿,並展現分布外泛化。

學習在 SageMaker 上實施可驗證獎勵強化學習 (RLVR),引入獎勵信號的驗證與透明度,提升訓練效能。結合 Group Relative Policy Optimization (GRPO) 和少樣本範例,改善數學問題解決準確度,使用 GSM8K 資料集,但適用於程式碼生成等任務。

SAIR Foundation 正式啟動「數學蒸餾挑戰賽」,開創 AI 數學推理新紀元。此挑戰旨在推進模型蒸餾技術,提升 AI 系統的數學表現。