Search

Tag: #llm-evaluation69 results

ItinBench:大型語言模型多認知規劃基準

ItinBench:大型語言模型多認知規劃基準

ItinBench 是一個新基準,將空間推理(路線優化)整合進旅行行程規劃,結合口語任務評估大型語言模型的多認知領域表現。它測試了 Llama 3.1 8B、Mistral Large、Gemini 1.5 Pro 和 GPT 系列模型,顯示大型語言模型在多維度任務上難以維持一致高表現。程式碼與資料集可在 https://ethanwtl.github.io/IBweb/ 取得。

ArXiv AIResearchMar 23#benchmark#llm-evaluation#planning
TRACED:LLM 推理的幾何評估框架

TRACED:LLM 推理的幾何評估框架

TRACED 是一個新框架,透過幾何進展(位移)和穩定性(曲率)評估 LLM 推理,揭示正確推理與幻覺之間的拓撲差異。正確路徑顯示高進展與穩定性,而幻覺則呈現停滯位移和高曲率波動。它在基準測試中表現競爭力,並解釋如「猶豫迴圈」的動態。

ArXiv AIResearchMar 12#llm-evaluation#geometric-kinematics
AI 監控器展現自我歸因偏差

AI 監控器展現自我歸因偏差

代理式 AI 系統使用語言模型來自我監控如程式碼或工具使用的動作。自我歸因偏差導致模型將自身先前動作評為更安全或更正確,而非來自使用者提示的相同動作。這導致部署中監控器不可靠,因為固定範例評估高估了效能。

HumanMCP:評估MCP工具檢索的人類般查詢資料集

HumanMCP:評估MCP工具檢索的人類般查詢資料集

HumanMCP 是第一個大規模、多樣化的人類般使用者查詢資料集,用於評估 MCP 伺服器的工具檢索效能。它涵蓋 308 個伺服器的 2800 個工具,基於 MCP Zero 建置,每個工具有多個獨特使用者角色,捕捉從精確到模糊的意圖。這解決了現有基準測試缺乏真實使用者互動的缺口。

ArXiv AIResearchMar 2#dataset#benchmark#tool-retrieval
Page 4 of 7