📄較早收集於 20h

ODAR:適應路由革新 LLM 推理

ODAR:適應路由革新 LLM 推理
PostLinkedIn
📄閱讀原文: ArXiv AI
#active-inference#adaptive-routing#free-energy#test-time-computeodar-expertllama-4deepseek

💡MATH 98.2% 準確率、計算減 82%:適應路由勝過 LLM 暴力取樣(68字)

⚡ 30-Second TL;DR

有什麼變化

透過折現主動推斷難度估計器實現動態路由

為什麼重要

ODAR 將 LLM 推理從昂貴均勻取樣轉向原則性適應分配,提升準確率-效率權衡。這可大幅降低生產系統推理成本,同時推動基準前沿。

下一步行動

使用開放原始碼在 Llama 推理管線中實作 ODAR 路由。

誰應關注:Researchers & Academics

關鍵要點

  • 透過折現主動推斷難度估計器實現動態路由
  • 風險敏感融合最小化變分自由能(對數似然 + 變異熵)
  • MATH 達 98.2% 準確率,HLE 54.8%
  • 開放原始碼堆疊上超越暴力取樣,減少 82% 計算成本
  • 23 項基準驗證,提升計算-準確率前沿

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • ODAR-Expert 架構包含輕量級調度層,包括專家路由器(ER)提取任務特徵、模型路由器(MR)選擇基模型,以及策略選擇器(SS)映射難度與特徵至推理路徑與解碼預算。[2]
  • 難度估計器基於折現主動推斷(amortized active inference),將查詢動態路由至啟發式快速代理(Fast Agent)或審議式緩慢代理(Slow Agent)。[2]
  • 融合機制採用自由能原理(FEP)與異質對齊,透過最小化變分自由能目標選擇答案,平衡對數似然與認知不確定性(varentropy)。[2]
📊 競品分析▸ Show
框架主要特徵基準表現成本節省
ODAR-Expert主動推斷難度估計 + 快/慢代理 + 自由能融合MATH 98.2%, HLE 54.8%82% (Llama 4 + DeepSeek) [1][7]
BEST-Route基於查詢難度選擇模型與取樣次數成本減60%, 性能降<1%60% [3]
UniRoute基於LLM預測錯誤特徵向量叢集路由優於ZeroRouter等基線未指定 [5]

🛠️ 技術深入

  • 系統概覽:模組化端到端推理系統,包含難度估計器(3.2)、雙代理架構(3.3)、自適應路由策略(3.4)、FEP融合(3.5)與完整演算法(3.6)。[2]
  • 規則基調度:專家路由器(ER)提取粗略任務特徵賦予專家類型e,模型路由器(MR)從能力資料庫選模型m,策略選擇器(SS)映射(d,e,特徵)至推理路徑與解碼預算。[2]
  • 開源配置:支援Llama 4 Scout + DeepSeek V3.2,平均準確率84.4%,歸一化成本從25x降至4.5x。[7]

🔮 前景展望AI analysis grounded in cited sources

ODAR將推動LLM推理從均勻取樣轉向主動推斷資源分配
其自由能決策機制提供原理性替代,連接LLM協調至神經科學推理視角,提升計算-準確率前沿。[1]
開放原始碼堆疊將加速社區重現與改進
在Llama 4 + DeepSeek上超越暴力取樣並減82%成本,驗證可重現性並促進產業採用。[1][7]

時間線

2026-02
arXiv發布ODAR-Expert論文(arXiv:2602.23681v1),提出基於主動推斷的適應路由框架。[1]
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。