Search

Tag: #planning10 results

EGB 提升大型工具空間長視野規劃

EGB 提升大型工具空間長視野規劃

推出 SLATE,一個大型電子商務基準測試,用於評估工具增強 LLM 代理,暴露自我修正與搜尋效率問題。提出熵引導分支 (EGB),一種不確定性感知演算法,優先高熵決策分支。在 SLATE 上實現更高成功率與計算效率。

ArXiv AIResearchApr 16#agent#benchmark#planning
ItinBench:大型語言模型多認知規劃基準

ItinBench:大型語言模型多認知規劃基準

ItinBench 是一個新基準,將空間推理(路線優化)整合進旅行行程規劃,結合口語任務評估大型語言模型的多認知領域表現。它測試了 Llama 3.1 8B、Mistral Large、Gemini 1.5 Pro 和 GPT 系列模型,顯示大型語言模型在多維度任務上難以維持一致高表現。程式碼與資料集可在 https://ethanwtl.github.io/IBweb/ 取得。

ArXiv AIResearchMar 23#benchmark#llm-evaluation#planning
LLM-WikiRace 揭示 LLM 規劃限制

LLM-WikiRace 揭示 LLM 規劃限制

LLM-WikiRace 是一個新基準,用於評估大型語言模型透過維基百科超連結從來源頁面導航至目標頁面的長期規劃與推理能力。先進模型如 Gemini-3、GPT-5 和 Claude Opus 4.5 在簡單層級表現出色,但在困難層級成功率僅 23%。分析顯示,知識僅是必要條件,超過門檻後規劃能力主導,且頂尖模型在錯誤後難以重新規劃。

ArXiv AIResearchFeb 20#benchmark#planning#reasoning
因果 POMDP 處理分佈偏移規劃

因果 POMDP 處理分佈偏移規劃

這篇 arXiv 論文提出因果 POMDP 框架,透過將變化建模為干預來處理分佈偏移下的規劃。它能評估假設變化下的計劃,並識別環境變更組件。此方法維護潛在狀態與領域的信念,證明價值函數保持分段線性凸形以利可處理規劃。