DataEvolver: Zelf-evoluerende multi-agent dataconstructie voor tekstrijke beeldgeneratie
DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation
June 30, 2026
Auteurs: Siyu Yan, Yizhen Gao, Yilin Wang, Dongxing Mao, Alex Jinpeng Wang
cs.AI
Samenvatting
De generatie van tekstrijke afbeeldingen is een van de meest uitdagende taken in beeldgeneratie, omdat modellen tegelijkertijd visueel realistische afbeeldingen moeten produceren en leesbare, semantisch afgestemde en lay-out-consistente tekst moeten weergeven. Bestaande datapijplijnen volgen doorgaans een statisch crawl-filter-freeze-paradigma. Ze verzamelen kandidaatmonsters, filteren deze eenmalig en bevriezen de geaccepteerde data voor training. Afgewezen monsters worden echter meestal weggegooid, hoewel ze vaak bruikbare faalsignalen bevatten, zoals OCR-fouten en semantische mismatches. Als gevolg hiervan kunnen latere constructieronden dezelfde faalmodi herhalen. Om deze beperkingen aan te pakken stellen we DataEvolver voor, een zelf-evoluerend multi-agent-kader voor de constructie van tekstrijke beelddata. DataEvolver beschouwt dataconstructie als feedback-gestuurde evolutie van het constructiebeleid. Een Retriever verzamelt kandidaatmonsters, een Verifier kent kwaliteitsscores en afwijzingsredenen toe, een Critic vat feedback op rondniveau samen tot semantische feedback, en een Generator vult onderbedekte gebieden aan door middel van gerichte synthese. Het bijgewerkte feedbackgeheugen stuurt vervolgens de volgende constructieronde. Experimenten op benchmarks voor tekstrijke beeldgeneratie tonen aan dat DataEvolver, onder gelijke databudgetten, nuttigere trainingsdata produceert dan vaste-dataset-baselines. Op de schaal van 0,75M voor PixArt-alpha verbetert DataEvolver de OCR-F1 met 85,3 procent op TextScenesHQ en met 35,3 procent op LongTextBench ten opzichte van de sterkste baseline. De verbeteringen zijn consistent over beide geëvalueerde benchmarks en zijn ook overdraagbaar naar Show-o2, wat aangeeft dat het voordeel van DataEvolver niet gebonden is aan één enkele stroomafwaartse generator. Deze resultaten suggereren dat afgewezen monsters bruikbare feedback kunnen leveren voor het verbeteren van de constructie van tekstrijke beelddata.
English
Text-rich image generation is one of the most challenging settings in image generation, since models must simultaneously produce visually realistic images and render legible, semantically aligned, and layout-consistent text. Existing data pipelines usually follow a static crawl-filter-freeze paradigm. They collect candidate samples, filter them once, and freeze the accepted data for training. However, rejected samples are usually discarded, although they often contain useful failure signals such as OCR errors and semantic mismatches. As a result, later construction rounds may repeat the same failure modes. To address these limitations, we propose DataEvolver, a self-evolving multi-agent framework for text-rich image data construction. DataEvolver treats data construction as feedback-driven construction policy evolution. A Retriever collects candidate samples, a Verifier assigns quality scores and rejection causes, a Critic summarizes round-level feedback into semantic feedback, and a Generator completes under-covered regions through targeted synthesis. The updated feedback memory then guides the next construction round. Experiments on text-rich image generation benchmarks show that DataEvolver produces more useful training data than fixed-dataset baselines under matched data budgets. At the 0.75M scale on PixArt-alpha, DataEvolver improves OCR-F1 over the strongest baseline by 85.3 percent on TextScenesHQ and 35.3 percent on LongTextBench. The improvements are consistent across both evaluated benchmarks and also transfer to Show-o2, indicating that the benefit of DataEvolver is not tied to a single downstream generator. These results suggest that rejected samples can provide actionable feedback for improving text-rich image data construction.