Search

Tag: #benchmark195 results

GISTBench:LLM 用戶理解基準測試

GISTBench:LLM 用戶理解基準測試

GISTBench 評估大型語言模型從推薦系統互動歷史中提取並驗證用戶興趣的能力,與傳統項目預測基準不同。它引入興趣基於性(IG)和興趣特定性(IS)指標,並發布來自短影片平台的合成資料集。對八個開源權重 LLM(7B 至 120B 參數)的評估揭示了在計數和歸因異質互動方面的性能瓶頸。

ChartDiff:理解圖表對的大型基準測試

ChartDiff:理解圖表對的大型基準測試

ChartDiff 推出首個跨圖表比較摘要的大型基準測試,包含 8,541 個多樣化圖表對,並附有人工驗證的差異摘要。評估顯示通用模型在品質上表現最佳,但專門方法雖 ROUGE 分數較高,卻在人類對齊評估中落後。多系列圖表仍是視覺語言模型的持續挑戰。

ArXiv AIResearchApr 1#benchmark#charts
LLM 自省基準與分類法

LLM 自省基準與分類法

研究人員將 LLM 自省形式化為對政策與參數的潛在運算,並推出 Introspect-Bench 進行嚴格測試。前沿模型展現特權自預測能力,優於同儕。因果證據顯示自省透過注意力擴散自然出現,無需明確訓練。

AgentComm-Bench:壓力測試具身AI通訊

AgentComm-Bench:壓力測試具身AI通訊

AgentComm-Bench 推出基準測試套件,用以評估合作式具身 AI 在延遲、封包遺失及頻寬崩潰等真實網路損害下的表現。它測試三類任務—感知、導航及區域搜尋—橫跨五種通訊策略,揭示導航任務高達 96% 效能下降。該套件提出冗餘訊息編碼以提升穩健性,並已公開發布。

ArXiv AIResearchMar 24#embodied-ai#multi-agent#benchmark
ItinBench:大型語言模型多認知規劃基準

ItinBench:大型語言模型多認知規劃基準

ItinBench 是一個新基準,將空間推理(路線優化)整合進旅行行程規劃,結合口語任務評估大型語言模型的多認知領域表現。它測試了 Llama 3.1 8B、Mistral Large、Gemini 1.5 Pro 和 GPT 系列模型,顯示大型語言模型在多維度任務上難以維持一致高表現。程式碼與資料集可在 https://ethanwtl.github.io/IBweb/ 取得。

ArXiv AIResearchMar 23#benchmark#llm-evaluation#planning
Page 10 of 20