📄ArXiv AI•較早收集於 9h
ItinBench:大型語言模型多認知規劃基準

#benchmark#llm-evaluation#planning#cognitive-reasoningitinbenchllama-3.1-8bmistral-largegemini-1.5-progpt
💡新基準顯示頂尖 LLM 在多認知規劃任務掙扎(22字元)
⚡ 30-Second TL;DR
有什麼變化
推出 ItinBench,用於結合空間(路線優化)與口語推理的旅行規劃
為什麼重要
ItinBench 揭露大型語言模型在真實世界多領域規劃的限制,促使開發更穩健模型。它為反映複雜挑戰的全面基準樹立標準。
下一步行動
從 https://ethanwtl.github.io/IBweb/ 下載 ItinBench 資料集,測試您的 LLM 在多認知規劃上的表現。
誰應關注:Researchers & Academics
關鍵要點
- •推出 ItinBench,用於結合空間(路線優化)與口語推理的旅行規劃
- •評估 Llama 3.1 8B、Mistral Large、Gemini 1.5 Pro、GPT 模型
- •揭示大型語言模型在同時多認知任務上表現不佳
- •開源程式碼/資料集:https://ethanwtl.github.io/IBweb/
🧠 深度解析
本篇為 AI 生成分析,非原文內容。
🔑 增強重點摘要
- •ItinBench 採用了動態約束滿足問題(Dynamic Constraint Satisfaction Problems)框架,要求模型在處理旅行規劃時,必須同時滿足時間窗口、預算限制及地理空間鄰近性等多重複雜約束。
- •研究指出,現有大型語言模型在處理 ItinBench 時,常出現「規劃幻覺」(Planning Hallucinations),即模型能生成看似合理的行程,但在實際執行路線優化計算時會違反邏輯或物理限制。
- •該基準測試引入了「多認知路徑」(Multi-cognitive Path)評估指標,旨在量化模型在從語義理解轉換到數值空間推理過程中的資訊遺失率。
🛠️ 技術深入
- •資料集架構:包含超過 1,000 個真實世界城市地理數據點,並結合了基於圖論(Graph Theory)的距離矩陣以驗證路線合理性。
- •評估機制:採用自動化評估腳本,結合 LLM-as-a-judge 與確定性演算法(如 Dijkstra 演算法)來驗證模型生成的行程是否為最短路徑或符合約束條件。
- •任務類型:涵蓋單日行程規劃、多日跨城市行程優化,以及包含突發事件(如景點臨時關閉)的動態重新規劃任務。
🔮 前景展望AI analysis grounded in cited sources
ItinBench 將推動大型語言模型向「神經符號 AI」(Neuro-symbolic AI)架構轉型。
純神經網路模型在處理嚴格的空間與數值約束時表現不穩,未來規劃類任務將更依賴與外部求解器(Solvers)的深度整合。
旅行規劃類 AI 代理(Agents)的評估標準將從單純的語言流暢度轉向邏輯一致性。
ItinBench 的出現確立了空間推理能力作為衡量 AI 代理在現實世界任務中實用性的關鍵指標。
⏳ 時間線
2025-11
ItinBench 專案啟動,開始收集全球主要城市的地理與旅遊數據。
2026-02
完成基準測試框架開發,並對首批模型(Llama 3.1, Mistral Large 等)進行基準評估。
2026-03
正式於 ArXiv 發布 ItinBench 研究論文並開源相關資料集與評估程式碼。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。
