
EGB 提升大型工具空間長視野規劃
推出 SLATE,一個大型電子商務基準測試,用於評估工具增強 LLM 代理,暴露自我修正與搜尋效率問題。提出熵引導分支 (EGB),一種不確定性感知演算法,優先高熵決策分支。在 SLATE 上實現更高成功率與計算效率。
Tag: #planning10 results

推出 SLATE,一個大型電子商務基準測試,用於評估工具增強 LLM 代理,暴露自我修正與搜尋效率問題。提出熵引導分支 (EGB),一種不確定性感知演算法,優先高熵決策分支。在 SLATE 上實現更高成功率與計算效率。

新方法將離線強化學習從局部模仿轉變為全域策略規劃。獲ICLR 2026錄取,從畫大綱轉向扣細節。此進展提升無即時互動的RL能力。

Yann LeCun的世界模型現可在單一GPU上高效運行。它展現極快速度,完整規劃任務僅需1秒。這是AI世界模型效率上的重大突破。

ItinBench 是一個新基準,將空間推理(路線優化)整合進旅行行程規劃,結合口語任務評估大型語言模型的多認知領域表現。它測試了 Llama 3.1 8B、Mistral Large、Gemini 1.5 Pro 和 GPT 系列模型,顯示大型語言模型在多維度任務上難以維持一致高表現。程式碼與資料集可在 https://ethanwtl.github.io/IBweb/ 取得。
LLM-WikiRace 是一個新基準,用於評估大型語言模型透過維基百科超連結從來源頁面導航至目標頁面的長期規劃與推理能力。先進模型如 Gemini-3、GPT-5 和 Claude Opus 4.5 在簡單層級表現出色,但在困難層級成功率僅 23%。分析顯示,知識僅是必要條件,超過門檻後規劃能力主導,且頂尖模型在錯誤後難以重新規劃。

本研究探討了圖世界模型(GWMs)在長程規劃中誤差累積的挑戰。研究提出了 Error-Aware GWM 框架,利用譜正則化與關鍵節點加權技術,有效防止動態圖環境中的預測發散。

Google 正在 Gemini Business 上測試多代理規劃模式。此企業功能於 Workspace 中,識別代理任務專家並產生委派計劃。旨在簡化商業環境中的複雜任務協調。

這篇 arXiv 論文提出因果 POMDP 框架,透過將變化建模為干預來處理分佈偏移下的規劃。它能評估假設變化下的計劃,並識別環境變更組件。此方法維護潛在狀態與領域的信念,證明價值函數保持分段線性凸形以利可處理規劃。

小紅書点点AI分析筆記、評論、影片提取洞見,歸納避雷,並推出「攻略模式」生成親子旅行等可執行計劃。利用社群真實經驗勝通用數據。以地圖和時序彌補資訊斷層。
使用 ChatGPT 產生想法、組織思維,並將粗略概念轉化為可行動計劃。有效結構化腦storm。適合創意工作流程。