ChatPaper.aiChatPaper

Avançando o Reconhecimento de Texto em Cena Orientado a WordArt: Conjuntos de Dados e Métodos

Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods

June 23, 2026
Autores: Xingsong Ye, Yongkun Du, Jiaxin Zhang, Haojie Zhang, Chong Sun, Chen Li, Jing Lyu, Zhineng Chen
cs.AI

Resumo

WordArt (texto artístico) apresenta fontes, texturas e layouts altamente personalizados, tornando o WATER (Reconhecimento de Texto em Cena Orientado a WordArt) substancialmente mais desafiador do que o STR (Reconhecimento de Texto em Cena) geral. Os conjuntos de dados e métodos de STR existentes, tipicamente construídos em torno de texto de cena regular e entradas de template fixo, têm dificuldade para escalar para WATER. Assim, visamos avançar nessa tarefa tanto sob a perspectiva dos dados quanto dos modelos. No lado dos dados, construímos um conjunto de dados sintético de 2M, WATER-S, com escala aumentada centenas de vezes em relação aos dados de texto artístico existentes. WATER-S consiste em dois subconjuntos complementares. Um renderizado por um pipeline de renderização atualizado (SynthWordArt), que fornece dados WordArt sintéticos altamente precisos e controláveis. O outro é gerado combinando Qwen3-VL para mineração de prompts e Z-Image para síntese de imagens, o que melhora a cobertura de dados realistas e diversos. No lado do modelo, propomos WATERec. Ele adota um codificador visual que suporta entradas de formato arbitrário e um decodificador autorregressivo para modelar layouts complexos, rompendo estruturalmente o gargalo do STR de template fixo em WordArt. Experimentos mostram que essa arquitetura supera métodos anteriores de STR, alcançando desempenho estado da arte em textos irregulares como WordArt. Em conjunto com WATER-R, cuidadosamente reorganizado a partir de dados STR reais existentes, nossa linha de base robusta com os novos dados sintéticos e design de modelo atinge 90,40% de precisão no WordArt-Bench, superando por ampla margem tanto modelos de visão-linguagem de propósito geral quanto especializados em OCR. Código e dados estão disponíveis em https://github.com/YesianRohn/WATER.
English
WordArt (artistic text) features highly customized fonts, textures, and layouts, making WordArt-oriented scene TExt Recognition (WATER) substantially more challenging than general Scene Text Recognition (STR). Existing STR datasets and methods, typically built around regular scene text and fixed-template inputs, struggle to scale to WATER. Thus, we aim to advance this task from both data and model perspectives. On the data side, we construct a 2M synthetic dataset, WATER-S, with the scale improved by hundreds of times compared to existing artistic text data. WATER-S consists of two complementary subsets. One rendered by an upgraded rendering pipeline (SynthWordArt), which provides highly accurate and controllable synthetic WordArt data. The other is generated by combining Qwen3-VL for prompt mining and Z-Image for image synthesis, which improves the coverage of realistic and diverse data. On the model side, we propose WATERec. It adopts an visual encoder supporting arbitrary-shaped inputs and an autoregressive decoder to model complex layouts, structurally breaking the bottleneck of fixed-template STR on WordArt. Experiments show that this architecture outperforms prior STR methods, achieving state-of-the-art performance on irregular texts such as WordArt. Together with WATER-R, carefully reorganized from existing real STR data, our strong baseline with the new synthetic data and model design reaches 90.40% accuracy on WordArt-Bench, surpassing both general-purpose and OCR-specialized vision-language models by a large margin. Code and data are available at https://github.com/YesianRohn/WATER.