Search

直接匹配不多,已補上最新動態。

Tag: #free-energy3 results

ODAR:適應路由革新 LLM 推理

ODAR:適應路由革新 LLM 推理

ODAR-Expert 提出 LLM 適應路由框架,透過基於主動推斷的難度估計器,動態將查詢導向快速啟發式代理或緩慢審議代理。它採用自由能融合機制,最小化變分自由能目標,平衡對數似然與認知不確定性。在 23 項基準測試中達到 MATH 98.2% 準確率與 HLE 54.8%,並在 Llama 4 + DeepSeek 上節省 82% 計算成本。

LLM後訓練:能力引發 vs 創造

LLM後訓練:能力引發 vs 創造

這篇arXiv論文區分能力引發(在可及支持內重新加權現有行為)與能力創造(擴展模型可及行為)。它使用自由能框架,SFT透過示範重新加權,RL透過獎勵。焦點轉向後訓練是否維持局部或透過搜尋/工具擴展。

ArXiv AIResearchMay 12#free-energy#sft-rl
主動推斷:AI系統代理性表型方法

主動推斷:AI系統代理性表型方法

研究人員提出AI代理性的最小定義,基於意圖性、理性與可解釋性,以變分POMDP模型最小化預期自由能為基礎。在T迷宮範式中,他們展示賦權(動作與觀測間通道容量)如何區分零、中、高代理性表型。此研究建議AI治理從外部約束轉向內部先驗偏好調變。

ArXiv AIResearchApr 29#ai-agency#empowerment#free-energy
Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。