ChatPaper.aiChatPaper

VeriEvol : Mise à l'échelle du raisonnement mathématique multimodal via Evol-Instruct vérifiable

VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

June 22, 2026
Auteurs: Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang
cs.AI

Résumé

L’augmentation d’échelle de l’apprentissage par renforcement pour le raisonnement mathématique visuel nécessite plus que la simple génération de questions plus difficiles : à mesure que le volume de données croît, les étiquettes de récompense elles-mêmes doivent rester fiables. Or, les pipelines de données existants mettent à l’échelle la supervision tout en faisant confiance à l’annotateur, et les méthodes côté politique supposent que les réponses sous-jacentes sont déjà correctes. Nous considérons plutôt l’augmentation d’échelle comme un problème de construction de données vérifiables et désolidarisons deux axes avant toute mise à jour de la politique : la difficulté des prompts, élargie par des opérateurs d’évolution spécifiques à chaque route, et la fiabilité des réponses, garantie par une falsification d’hypothèses hors ligne. Nous concrétisons cette approche sous la forme de VeriEvol, un cadre itératif doté de deux composants extensibles : un module d’évolution sensible au type qui reformule des images-questions de départ à faible difficulté en prompts plus difficiles, ancrés dans l’image ; et HTV-Agent, un vérificateur qui n’accepte une réponse qu’après que des contre-preuves multi-sources ont échoué à la réfuter. Les données vérifiées qui en résultent augmentent en volume, s’étendent par l’ajout de routes d’évolution ou de canaux de vérification, et s’intègrent directement dans les recettes RL existantes de type GRPO. Sur une suite de cinq benchmarks de mathématiques visuelles, l’augmentation d’échelle des données SFT évoluées de 10 K à 250 K échantillons fait passer la précision moyenne de 35,42 à 54,73 ; puis, le backbone, l’initialisation SFT et la recette GRPO étant maintenus constants, VeriEvol ajoute cumulativement +3,88 par rapport à un RL de base non évolué, dont +1,82 proviennent des prompts évolués et +2,06 du vérificateur HTV-Agent. Nous publions les prompts, les données, les modèles, le code ainsi que la trace complète du vérificateur pour chaque échantillon, afin que les travaux ultérieurs puissent mettre à l’échelle et auditer le pipeline plutôt que d’en inspecter seulement les sorties.
English
Scaling reinforcement learning for visual mathematical reasoning requires more than generating harder questions: as data volume grows, the reward labels themselves must remain reliable. Yet existing data pipelines scale supervision while trusting the labeller, and policy-side methods assume the underlying answers are already correct. We instead treat scaling as a verifiable data-construction problem and decouple two axes before any policy update: prompt difficulty, expanded by route-specific evolution operators, and answer reliability, enforced by offline hypothesis-test falsification. We instantiate this as VeriEvol, an iterative framework with two extensible components: a type-aware evolution module that rewrites low-difficulty image-question seeds into harder, image-grounded prompts; and HTV-Agent, a verifier that accepts an answer only after multi-source counter-evidence has failed to refute it. The resulting verified data scales in volume, extends by adding evolution routes or verifier channels, and plugs directly into existing GRPO-style RL recipes. On a five-benchmark visual-math suite, scaling evolved SFT data from 10K to 250K samples raises the mean accuracy from 35.42 to 54.73; then, with backbone, SFT initialization, and GRPO recipe held fixed, VeriEvol adds a cumulative +3.88 over an un-evolved RL baseline, of which +1.82 comes from evolved prompts and +2.06 from the HTV-Agent verifier. We release the prompts, data, models, code, and the full verifier trace of every sample, so that downstream work can scale and audit the pipeline rather than only inspect its outputs.