Search

Tag: #psychometrics7 results

生成式AI模型世代認知發展不均

生成式AI模型世代認知發展不均

研究人員開發心理測驗框架,評估生成式AI認知輪廓與人類標準比較,顯示語言理解和工作記憶表現頂尖,但感知推理幾近失敗。AIQ基準測試追蹤六代兩家族模型,揭示不對稱進展,語言任務遠勝視覺,顯示語言偏誤。此結果顯示單靠擴展無法實現均衡AGI。

ArXiv AIResearchMay 11#cognition#psychometrics#multimodal
視覺語言模型預測題目難度

視覺語言模型預測題目難度

研究人員使用 GPT-4.1-nano 透過文字、圖像或兩者預測資料視覺化素養測試題目的難度。多模態方法達到最低 MAE 0.224,優於僅文字(0.338)和僅視覺(0.282)。保留測試集 MSE 為 0.108,證明 LLM 在心理測量學的潛力。

ArXiv AIResearchMar 6#psychometrics#data-visualization