ChatPaper.aiChatPaper

Enriquecimento de Conteúdos Gerados

Generated Contents Enrichment

June 30, 2026
Autores: Mahdi Naseri, Jiayan Qiu, Zhou Wang
cs.AI

Resumo

Estudamos o Enriquecimento de Conteúdos Gerados (ECG), uma tarefa de geração condicional de imagens na qual uma descrição esparsa de cena é primeiro enriquecida por meio de uma representação explícita de cena e depois renderizada em conteúdo visual semanticamente mais rico. Sistemas convencionais de geração de imagens podem produzir resultados visualmente realistas a partir de descrições limitadas de cena, mas o conteúdo adicionado geralmente é implícito no gerador, em vez de representado como uma estrutura intermediária inspecionável. Em contraste, o ECG busca tornar o enriquecimento da cena explícito ao nível da representação da cena, enquanto examina suas consequências visuais durante a geração, com o objetivo de incentivar um conteúdo gerado que seja visualmente plausível, estruturalmente coerente e semanticamente mais rico do que a entrada esparsa. Para instanciar o ECG, propomos uma estrutura adversarial treinada conjuntamente que enriquece grafos de cena modelando a semântica dos objetos e as relações entre objetos. Nossa abordagem primeiro representa a descrição de entrada como um grafo de cena, onde nós modelam objetos e arestas capturam relações entre objetos. A estrutura utiliza redes convolucionais em grafos para prever objetos adicionais e suas relações com a cena existente. Finalmente, o grafo de cena enriquecido é passado pelo pipeline de geração de imagens downstream para gerar o conteúdo visual correspondente. Avaliamos a estrutura com métricas proxy de enriquecimento de grafos de cena, comparações de qualidade de imagem, exemplos qualitativos e estudos de usuários no conjunto de dados Visual Genome.
English
We study Generated Contents Enrichment (GCE), a conditional image-generation task in which a sparse scene description is first enriched through an explicit scene representation and then rendered into semantically richer visual content. Conventional image-generation systems can produce visually realistic outputs from limited scene descriptions, but the added content is usually implicit in the generator rather than represented as an inspectable intermediate structure. In contrast, GCE seeks to make scene enrichment explicit at the scene-representation level while examining its visual consequences during generation, with the goal of encouraging generated content that is visually plausible, structurally coherent, and semantically richer than the sparse input. To instantiate GCE, we propose a jointly trained adversarial framework that enriches scene graphs by modeling object semantics and inter-object relations. Our approach first represents the input description as a scene graph, where nodes model objects and edges capture inter-object relations. The framework uses graph convolutional networks to predict additional objects and their relations to the existing scene. Finally, the enriched scene graph is passed through the downstream image-generation pipeline to generate the corresponding visual content. We evaluate the framework with proxy scene graph enrichment metrics, image-quality comparisons, qualitative examples, and user studies on the Visual Genome dataset.