VeriEvol: Escalando o Raciocínio Matemático Multimodal via Evol-Instruct Verificável
VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct
June 22, 2026
Autores: Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang
cs.AI
Resumo
Escalar a aprendizagem por reforço para raciocínio matemático visual exige mais do que gerar perguntas mais difíceis: à medida que o volume de dados cresce, os próprios rótulos de recompensa devem permanecer confiáveis. No entanto, os pipelines de dados existentes escalam a supervisão enquanto confiam no rotulador, e os métodos do lado da política assumem que as respostas subjacentes já estão corretas. Em vez disso, tratamos a escalabilidade como um problema de construção de dados verificáveis e desacoplamos dois eixos antes de qualquer atualização de política: a dificuldade do prompt, expandida por operadores de evolução específicos de rota, e a confiabilidade da resposta, imposta por falsificação por teste de hipóteses offline. Materializamos isso como VeriEvol, uma estrutura iterativa com dois componentes extensíveis: um módulo de evolução ciente do tipo que reescreve sementes de imagem-pergunta de baixa dificuldade em prompts mais difíceis e fundamentados em imagens; e HTV-Agent, um verificador que aceita uma resposta apenas depois que contra-evidências de múltiplas fontes falharam em refutá-la. Os dados verificados resultantes escalam em volume, estendem-se pela adição de rotas de evolução ou canais de verificação, e integram-se diretamente em receitas de RL estilo GRPO existentes. Em um conjunto de cinco benchmarks de matemática visual, escalar dados SFT evoluídos de 10 mil para 250 mil amostras eleva a precisão média de 35,42 para 54,73; em seguida, com backbone, inicialização SFT e receita GRPO fixos, VeriEvol adiciona um ganho cumulativo de +3,88 sobre uma linha de base de RL não evoluída, dos quais +1,82 vêm de prompts evoluídos e +2,06 do verificador HTV-Agent. Disponibilizamos os prompts, dados, modelos, código e o traço completo do verificador de cada amostra, para que trabalhos posteriores possam escalar e auditar o pipeline, em vez de apenas inspecionar suas saídas.
English
Scaling reinforcement learning for visual mathematical reasoning requires more than generating harder questions: as data volume grows, the reward labels themselves must remain reliable. Yet existing data pipelines scale supervision while trusting the labeller, and policy-side methods assume the underlying answers are already correct. We instead treat scaling as a verifiable data-construction problem and decouple two axes before any policy update: prompt difficulty, expanded by route-specific evolution operators, and answer reliability, enforced by offline hypothesis-test falsification. We instantiate this as VeriEvol, an iterative framework with two extensible components: a type-aware evolution module that rewrites low-difficulty image-question seeds into harder, image-grounded prompts; and HTV-Agent, a verifier that accepts an answer only after multi-source counter-evidence has failed to refute it. The resulting verified data scales in volume, extends by adding evolution routes or verifier channels, and plugs directly into existing GRPO-style RL recipes. On a five-benchmark visual-math suite, scaling evolved SFT data from 10K to 250K samples raises the mean accuracy from 35.42 to 54.73; then, with backbone, SFT initialization, and GRPO recipe held fixed, VeriEvol adds a cumulative +3.88 over an un-evolved RL baseline, of which +1.82 comes from evolved prompts and +2.06 from the HTV-Agent verifier. We release the prompts, data, models, code, and the full verifier trace of every sample, so that downstream work can scale and audit the pipeline rather than only inspect its outputs.