Search

Tag: #visual-reasoning12 results

Lang2Act Boosts VLM Visual Reasoning with Emergent Tools

Lang2Act Boosts VLM Visual Reasoning with Emergent Tools

Lang2Act enhances Vision-Language Models (VLMs) via self-emergent linguistic toolchains for fine-grained visual perception in VRAG, avoiding rigid external tools and info loss from image ops. It employs a two-stage RL framework: first to build a reusable action toolbox, second to exploit it for reasoning. Achieves >4% performance gains; code at GitHub.

ArXiv AIResearchFeb 17#visual-reasoning
7B AdaReasoner Outperforms GPT-5 in Visual Puzzles

7B AdaReasoner Outperforms GPT-5 in Visual Puzzles

AdaReasoner, a 7B model, achieves superior performance on visual reasoning tasks like puzzles by dynamically learning tool selection, timing, and usage. It introduces 'Agentic Vision' with iterative think-act-observe loops, outperforming larger models without massive scaling. Open-source code, models, and paper available on arXiv and GitHub.

机器之心MediaFeb 15#research#adareasoner#7b-model
Page 1 of 2