Search

Tag: #test-time-compute8 results

ODAR:適應路由革新 LLM 推理

ODAR:適應路由革新 LLM 推理

ODAR-Expert 提出 LLM 適應路由框架,透過基於主動推斷的難度估計器,動態將查詢導向快速啟發式代理或緩慢審議代理。它採用自由能融合機制,最小化變分自由能目標,平衡對數似然與認知不確定性。在 23 項基準測試中達到 MATH 98.2% 準確率與 HLE 54.8%,並在 Llama 4 + DeepSeek 上節省 82% 計算成本。

大型語言模型在潛在空間的自適應思考

大型語言模型在潛在空間的自適應思考

Apple研究展示大型語言模型(LLMs)在測試時計算中執行中間鏈式思考(CoT)推理,以提升生成答案前的思考能力。透過自一致性作為思考必要性的代理,探討模型能力、查詢複雜度與最佳預算分配的關係,以實現計算最優推理。增加思考預算可平滑提升效能,但需了解最佳配置。

Apple Machine LearningOfficialApr 29#chain-of-thought#test-time-compute#self-consistency
SSR 透過策略差距提升數學推理

SSR 透過策略差距提升數學推理

基於範例的數學推理指導不穩定,因為策略使用與可執行性之間存在差距,人類與模型策略存在系統性差異。論文提出 Selective Strategy Retrieval (SSR),一個測試時框架,使用多路徑訊號選擇性檢索並結合來源感知策略。SSR 在多個基準上提供一致提升,在 AIME25 上最高 +13 分,在 Apex 上 +5 分,適用於緊湊模型。

ArXiv AIResearchFeb 28#test-time-compute
SELFCEST:學習式並行模型克隆

SELFCEST:學習式並行模型克隆

SELFCEST 透過代理強化學習,讓基礎語言模型能在並行上下文中生成相同權重的克隆。訓練採用端到端方式,使用全域任務獎勵與共享參數 rollout 來分配分支預算。這在數學推理與長上下文 QA 基準上改善準確度-成本帕雷托前沿,並展現分布外泛化。