Search

Tag: #math-reasoning7 results

Apple 電路放大提升 LLM 數學推理

Apple 電路放大提升 LLM 數學推理

Apple 推出「建構性電路放大」方法,透過針對 LLM 中的稀疏子網路(稱為電路)來提升數學推理能力。此方法基於既有電路負責特定任務,且微調會強化這些電路的發現。該方法識別關鍵權杖以進行精準、任務導向的更新。

Apple Machine LearningOfficialFeb 25#circuits#math-reasoning#subnetworks
SELFCEST:學習式並行模型克隆

SELFCEST:學習式並行模型克隆

SELFCEST 透過代理強化學習,讓基礎語言模型能在並行上下文中生成相同權重的克隆。訓練採用端到端方式,使用全域任務獎勵與共享參數 rollout 來分配分支預算。這在數學推理與長上下文 QA 基準上改善準確度-成本帕雷托前沿,並展現分布外泛化。

使用 GRPO 實現可驗證獎勵強化學習

使用 GRPO 實現可驗證獎勵強化學習

學習在 SageMaker 上實施可驗證獎勵強化學習 (RLVR),引入獎勵信號的驗證與透明度,提升訓練效能。結合 Group Relative Policy Optimization (GRPO) 和少樣本範例,改善數學問題解決準確度,使用 GSM8K 資料集,但適用於程式碼生成等任務。

AWS Machine Learning BlogOfficialMay 7#verifiable-rewards#math-reasoning