DataEvolver: Construção de Dados Multiagente Auto-Evolutiva para Geração de Imagens Ricas em Texto
DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation
June 30, 2026
Autores: Siyu Yan, Yizhen Gao, Yilin Wang, Dongxing Mao, Alex Jinpeng Wang
cs.AI
Resumo
A geração de imagens ricas em texto é um dos cenários mais desafiadores na geração de imagens, pois os modelos devem simultaneamente produzir imagens visualmente realistas e renderizar texto legível, semanticamente alinhado e consistente com o layout. Os pipelines de dados existentes geralmente seguem um paradigma estático de rastreamento-filtragem-congelamento. Eles coletam amostras candidatas, filtram-nas uma vez e congelam os dados aceitos para treinamento. No entanto, as amostras rejeitadas são geralmente descartadas, embora frequentemente contenham sinais de falha úteis, como erros de OCR e incompatibilidades semânticas. Como resultado, rodadas posteriores de construção podem repetir os mesmos modos de falha. Para solucionar essas limitações, propomos o DataEvolver, uma estrutura multiagente autoevolutiva para construção de dados de imagens ricas em texto. O DataEvolver trata a construção de dados como uma evolução da política de construção orientada por feedback. Um Recuperador coleta amostras candidatas, um Verificador atribui pontuações de qualidade e causas de rejeição, um Crítico resume o feedback em nível de rodada em feedback semântico, e um Gerador completa regiões subcobertas por meio de síntese direcionada. A memória de feedback atualizada então orienta a próxima rodada de construção. Experimentos em benchmarks de geração de imagens ricas em texto mostram que o DataEvolver produz dados de treinamento mais úteis do que as linhas de base com conjuntos de dados fixos, sob orçamentos de dados equivalentes. Na escala de 0,75M no PixArt-alpha, o DataEvolver melhora o OCR-F1 em relação à linha de base mais forte em 85,3% no TextScenesHQ e 35,3% no LongTextBench. As melhorias são consistentes em ambos os benchmarks avaliados e também se transferem para o Show-o2, indicando que o benefício do DataEvolver não está vinculado a um único gerador downstream. Esses resultados sugerem que amostras rejeitadas podem fornecer feedback acionável para melhorar a construção de dados de imagens ricas em texto.
English
Text-rich image generation is one of the most challenging settings in image generation, since models must simultaneously produce visually realistic images and render legible, semantically aligned, and layout-consistent text. Existing data pipelines usually follow a static crawl-filter-freeze paradigm. They collect candidate samples, filter them once, and freeze the accepted data for training. However, rejected samples are usually discarded, although they often contain useful failure signals such as OCR errors and semantic mismatches. As a result, later construction rounds may repeat the same failure modes. To address these limitations, we propose DataEvolver, a self-evolving multi-agent framework for text-rich image data construction. DataEvolver treats data construction as feedback-driven construction policy evolution. A Retriever collects candidate samples, a Verifier assigns quality scores and rejection causes, a Critic summarizes round-level feedback into semantic feedback, and a Generator completes under-covered regions through targeted synthesis. The updated feedback memory then guides the next construction round. Experiments on text-rich image generation benchmarks show that DataEvolver produces more useful training data than fixed-dataset baselines under matched data budgets. At the 0.75M scale on PixArt-alpha, DataEvolver improves OCR-F1 over the strongest baseline by 85.3 percent on TextScenesHQ and 35.3 percent on LongTextBench. The improvements are consistent across both evaluated benchmarks and also transfer to Show-o2, indicating that the benefit of DataEvolver is not tied to a single downstream generator. These results suggest that rejected samples can provide actionable feedback for improving text-rich image data construction.