ChatPaper.aiChatPaper

Apprentissage de chemins de raisonnement adaptatifs pour un raisonnement visuel efficace

Learning Adaptive Reasoning Paths for Efficient Visual Reasoning

April 16, 2026
Auteurs: Yixu Huang, Tinghui Zhu, Muhao Chen
cs.AI

Résumé

Les modèles de raisonnement visuel (VRM) ont récemment démontré d'importantes capacités de raisonnement multimodal en intégrant la perception visuelle au raisonnement linguistique. Cependant, ils souffrent souvent de sur-réflexion, produisant des chaînes de raisonnement inutilement longues pour toutes les tâches. Nous attribuons ce problème à la redondance des chemins de raisonnement dans le raisonnement visuel : de nombreuses questions visuelles ne nécessitent pas un processus de raisonnement complet. Pour y remédier, nous proposons AVR, un cadre de raisonnement visuel adaptatif qui décompose le raisonnement visuel en trois fonctions cognitives : perception visuelle, raisonnement logique et application de la réponse. Il permet en outre aux modèles de choisir dynamiquement parmi trois formats de réponse : format complet, format perception uniquement et réponse directe. AVR est entraîné avec FS-GRPO, une adaptation de l'optimisation relative de stratégie de groupe qui encourage le modèle à sélectionner le format de raisonnement le plus efficace tout en préservant l'exactitude. Les expériences sur plusieurs benchmarks vision-langage montrent qu'AVR réduit l'utilisation de tokens de 50 à 90 % tout en maintenant la précision globale, particulièrement dans les tâches intensives en perception. Ces résultats démontrent que le raisonnement visuel adaptatif peut atténuer efficacement la sur-réflexion dans les VRM. Le code et les données sont disponibles à l'adresse : https://github.com/RunRiotComeOn/AVR.
English
Visual reasoning models (VRMs) have recently shown strong cross-modal reasoning capabilities by integrating visual perception with language reasoning. However, they often suffer from overthinking, producing unnecessarily long reasoning chains for any tasks. We attribute this issue to Reasoning Path Redundancy in visual reasoning: many visual questions do not require the full reasoning process. To address this, we propose AVR, an adaptive visual reasoning framework that decomposes visual reasoning into three cognitive functions: visual perception, logical reasoning, and answer application. It further enables models to dynamically choose among three response formats: Full Format, Perception-Only Format, and Direct Answer. AVR is trained with FS-GRPO, an adaptation of Group Relative Policy Optimization that encourages the model to select the most efficient reasoning format while preserving correctness. Experiments on multiple vision-language benchmarks show that AVR reduces token usage by 50--90\% while maintaining overall accuracy, especially in perception-intensive tasks. These results demonstrate that adaptive visual reasoning can effectively mitigate overthinking in VRMs. Code and data are available at: https://github.com/RunRiotComeOn/AVR.