Search

Tag: #cognition9 results

生成式AI模型世代認知發展不均

生成式AI模型世代認知發展不均

研究人員開發心理測驗框架,評估生成式AI認知輪廓與人類標準比較,顯示語言理解和工作記憶表現頂尖,但感知推理幾近失敗。AIQ基準測試追蹤六代兩家族模型,揭示不對稱進展,語言任務遠勝視覺,顯示語言偏誤。此結果顯示單靠擴展無法實現均衡AGI。

ArXiv AIResearchMay 11#cognition#psychometrics#multimodal
CogARC數據集揭示人類ARC策略

CogARC數據集揭示人類ARC策略

研究人員推出CogARC,這是ARC的適應人類子集,包含75個視覺推理任務,由260名參與者測試,準確率約85%。高解析度數據記錄觀看、編輯和嘗試,顯示困難問題上的多樣策略,即使錯誤解決方案也趨於收斂。發現突顯人類在不確定性下的泛化,為AI基準測試提供洞見。

ArXiv AIResearchFeb 27#abstract-reasoning#human-ai#dataset