
衡量超越人類能力的 AI 智慧
這項研究提出了一種評估超越人類能力 AI 模型的新範式,透過相對衡量而非靜態基準來進行評估。該框架利用模型生成的挑戰,建立了一套能隨代理能力同步擴展的對抗性心理測量評分系統。
Tag: #psychometrics7 results

這項研究提出了一種評估超越人類能力 AI 模型的新範式,透過相對衡量而非靜態基準來進行評估。該框架利用模型生成的挑戰,建立了一套能隨代理能力同步擴展的對抗性心理測量評分系統。

研究人員開發心理測驗框架,評估生成式AI認知輪廓與人類標準比較,顯示語言理解和工作記憶表現頂尖,但感知推理幾近失敗。AIQ基準測試追蹤六代兩家族模型,揭示不對稱進展,語言任務遠勝視覺,顯示語言偏誤。此結果顯示單靠擴展無法實現均衡AGI。

研究人員開發了 GenAI-RTS,這是一項包含 20 個項目的心理測量驗證工具,用於分類大學生對生成式 AI 的依賴方式。該量表識別出四種不同的依賴類型:策略型、工具型、依賴型和對話型,為未來的 AI 素養干預提供了框架。

這篇立場論文主張,項目級基準數據對AI評估科學至關重要,能解決當前範式的系統性有效性失敗。論文借鑑心理測量學與電腦科學,倡導細粒度診斷。OpenEval 被引入作為支持證據中心AI評估的儲存庫。

研究人員使用 AI 心理測量學和 TAM 評估 GPT-3.5、GPT-4、LLaMA-2 和 LLaMA-3 的心理推理能力。所有模型均符合有效性標準,GPT-4 和 LLaMA-3 表現更優異。

本文將心理測量評分者模型整合至AI評估中,以修正人類評分者的系統性錯誤。採用項目反應理論,特別是多面向Rasch模型,來分離輸出品質與評分者效應如嚴格度和中心性。在OpenAI摘要資料集上的應用,提供調整後的品質分數與評分者診斷,提升AI評估可靠性。

研究人員使用 GPT-4.1-nano 透過文字、圖像或兩者預測資料視覺化素養測試題目的難度。多模態方法達到最低 MAE 0.224,優於僅文字(0.338)和僅視覺(0.282)。保留測試集 MSE 為 0.108,證明 LLM 在心理測量學的潛力。