Amélioration des modèles vision-langue grâce à des modèles de récompense de processus centrés sur la perception
Improving Vision-language Models with Perception-centric Process Reward Models
April 27, 2026
Auteurs: Yingqian Min, Kun Zhou, Yifan Li, Yuhuan Wu, Han Peng, Yifan Du, Wayne Xin Zhao, Min Yang, Ji-Rong Wen
cs.AI
Résumé
Les récents progrès en apprentissage par renforcement avec récompenses vérifiables (RLVR) ont considérablement amélioré la capacité de raisonnement complexe des modèles vision-langage (VLM). Cependant, leur supervision au niveau des résultats est trop grossière pour diagnostiquer et corriger les erreurs au sein de la chaîne de raisonnement. À cette fin, nous proposons Perceval, un modèle de récompense de processus (PRM) qui permet un ancrage des erreurs au niveau des tokens, capable d'extraire les affirmations liées à l'image depuis la réponse et de les comparer une à une avec les preuves visuelles de l'image, pour finalement retourner les affirmations contenant des erreurs perceptives. Perceval est entraîné avec des données d'apprentissage supervisé intensives en perception. Nous intégrons ensuite Perceval dans le processus d'entraînement par RL pour entraîner les modèles de politique. Concrètement, par rapport au GRPO traditionnel qui applique des avantages au niveau de la séquence, nous appliquons des avantages au niveau des tokens en ciblant des pénalités sur les segments hallucinés identifiés par Perceval, permettant ainsi des signaux de supervision à granularité fine. En plus d'augmenter le processus d'entraînement, Perceval peut également assister les VLM durant la phase d'inférence. En utilisant Perceval, nous pouvons tronquer les parties erronées de la réponse du modèle, puis soit faire régénérer la réponse directement par le modèle, soit amener le modèle à réfléchir à sa sortie précédente. Ce processus peut être répété plusieurs fois pour réaliser un scaling au moment du test. Les expériences montrent des améliorations significatives sur des benchmarks de divers domaines pour plusieurs VLM de raisonnement entraînés par RL, soulignant le potentiel de la supervision centrée sur la perception comme stratégie universelle. Pour le scaling durant les tests, cela démontre également des gains de performance constants par rapport à d'autres stratégies, comme le vote majoritaire. Notre code et nos données seront publiquement disponibles à l'adresse https://github.com/RUCAIBox/Perceval.
English
Recent advancements in reinforcement learning with verifiable rewards (RLVR) have significantly improved the complex reasoning ability of vision-language models (VLMs). However, its outcome-level supervision is too coarse to diagnose and correct errors within the reasoning chain. To this end, we propose Perceval, a process reward model (PRM) that enables token-level error grounding, which can extract image-related claims from the response and compare them one by one with the visual evidence in the image, ultimately returning claims that contain perceptual errors. Perceval is trained with perception-intensive supervised training data. We then integrate Perceval into the RL training process to train the policy models. Specifically, compared to traditional GRPO, which applies sequence-level advantages, we apply token-level advantages by targeting penalties on hallucinated spans identified by Perceval, thus enabling fine-grained supervision signals. In addition to augmenting the training process, Perceval can also assist VLMs during the inference stage. Using Perceval, we can truncate the erroneous portions of the model's response, and then either have the model regenerate the response directly or induce the model to reflect on its previous output. This process can be repeated multiple times to achieve test-time scaling. Experiments show significant improvements on benchmarks from various domains across multiple reasoning VLMs trained with RL, highlighting the promise of perception-centric supervision as a general-purpose strategy. For test-time scaling, it also demonstrates consistent performance gains over other strategies, such as major voting. Our code and data will be publicly released at https://github.com/RUCAIBox/Perceval.