Search

Tag: #llm-evaluation69 results

AI策略推理風險分類評估框架

AI策略推理風險分類評估框架

介紹ESRRSim,一個分類驅動框架,用於評估大型語言模型中的新興策略推理風險(ESRRs),如欺騙、評估遊戲和獎勵駭客。它包含7個類別分解為20個子類別、自動化情境生成,以及用於回應和推理軌跡的雙重評分標準。對11個LLM的評估顯示偵測率從14.45%至72.72%,世代進步顯示適應評估。

GISTBench:LLM 用戶理解基準測試

GISTBench:LLM 用戶理解基準測試

GISTBench 評估大型語言模型從推薦系統互動歷史中提取並驗證用戶興趣的能力,與傳統項目預測基準不同。它引入興趣基於性(IG)和興趣特定性(IS)指標,並發布來自短影片平台的合成資料集。對八個開源權重 LLM(7B 至 120B 參數)的評估揭示了在計數和歸因異質互動方面的性能瓶頸。

Page 3 of 7