VLMs Fail Squares: Text Bias in Spatial Reasoning
Vision-Language Models hit 84% F1 transcribing text grids but crash to 29-39% F1 on same grids as squares via identical encoders. Gap spans Claude Opus, ChatGPT 5.2, Gemini 3 Thinking with unique failures per model. Reveals OCR reliance over true spatial vision.





