
Top AIs Score <1% on ARC-AGI-3, Humans 100%
GPT-5.5 and Claude Opus 4.7 scored below 1% (0.43% and 0.18%) on ARC-AGI-3 benchmark testing novel reasoning, while humans achieved 100% on first try. The test features 135 unseen environments requiring exploration, rule inference, and adaptation without priors. Analysis identifies failures in world modeling, training data biases, and superficial task success.






