
ODAR:適應路由革新 LLM 推理
ODAR-Expert 提出 LLM 適應路由框架,透過基於主動推斷的難度估計器,動態將查詢導向快速啟發式代理或緩慢審議代理。它採用自由能融合機制,最小化變分自由能目標,平衡對數似然與認知不確定性。在 23 項基準測試中達到 MATH 98.2% 準確率與 HLE 54.8%,並在 Llama 4 + DeepSeek 上節省 82% 計算成本。
Tag: #test-time-compute8 results

ODAR-Expert 提出 LLM 適應路由框架,透過基於主動推斷的難度估計器,動態將查詢導向快速啟發式代理或緩慢審議代理。它採用自由能融合機制,最小化變分自由能目標,平衡對數似然與認知不確定性。在 23 項基準測試中達到 MATH 98.2% 準確率與 HLE 54.8%,並在 Llama 4 + DeepSeek 上節省 82% 計算成本。
研究顯示,使用獨立驗證者進行測試時間計算擴展,比自我反思或無驗證者方法更有效。將驗證者與生成器解耦,被視為提升 AI 代理可靠性與性能的關鍵架構轉變。

Apple研究展示大型語言模型(LLMs)在測試時計算中執行中間鏈式思考(CoT)推理,以提升生成答案前的思考能力。透過自一致性作為思考必要性的代理,探討模型能力、查詢複雜度與最佳預算分配的關係,以實現計算最優推理。增加思考預算可平滑提升效能,但需了解最佳配置。

此新框架針對大型語言模型聯合調整測試時計算分配與生成分佈。暖身階段識別簡單查詢並從測試集建構初始問答對。適應階段集中計算於未解查詢,使用語義相近成功回應的演化式脈絡示範,在數學、程式與推理基準上超越基線且耗用更少推論計算。

蒙特卡羅樹搜索(MCTS)提升LLM推理但造成長尾延遲。新負早退機制修剪無效路徑,自適應加速重新分配計算資源。整合至vLLM,大幅降低p99延遲、提升吞吐量並維持準確度。

基於範例的數學推理指導不穩定,因為策略使用與可執行性之間存在差距,人類與模型策略存在系統性差異。論文提出 Selective Strategy Retrieval (SSR),一個測試時框架,使用多路徑訊號選擇性檢索並結合來源感知策略。SSR 在多個基準上提供一致提升,在 AIME25 上最高 +13 分,在 Apex 上 +5 分,適用於緊湊模型。
SELFCEST 透過代理強化學習,讓基礎語言模型能在並行上下文中生成相同權重的克隆。訓練採用端到端方式,使用全域任務獎勵與共享參數 rollout 來分配分支預算。這在數學推理與長上下文 QA 基準上改善準確度-成本帕雷托前沿,並展現分布外泛化。

Weaviate 為 Query Agent 的 Search Mode 推出 medium、high 與 ultrahigh 三種努力層級。這項更新讓實務使用者可依據搜尋品質與資源需求調整測試時運算量。