Search

直接匹配不多,已補上最新動態。

Tag: #user-profiling1 results

GISTBench:LLM 用戶理解基準測試

GISTBench:LLM 用戶理解基準測試

GISTBench 評估大型語言模型從推薦系統互動歷史中提取並驗證用戶興趣的能力,與傳統項目預測基準不同。它引入興趣基於性(IG)和興趣特定性(IS)指標,並發布來自短影片平台的合成資料集。對八個開源權重 LLM(7B 至 120B 參數)的評估揭示了在計數和歸因異質互動方面的性能瓶頸。