ChatPaper.aiChatPaper

Verrijking van gegenereerde inhoud

Generated Contents Enrichment

June 30, 2026
Auteurs: Mahdi Naseri, Jiayan Qiu, Zhou Wang
cs.AI

Samenvatting

We bestuderen Generated Contents Enrichment (GCE), een conditionele beeldgeneratietaak waarbij een schaarse scènebeschrijving eerst wordt verrijkt via een expliciete scenerepresentatie en vervolgens wordt gerenderd tot semantisch rijkere visuele inhoud. Conventionele beeldgeneratiesystemen kunnen visueel realistische output produceren op basis van beperkte scènebeschrijvingen, maar de toegevoegde inhoud blijft doorgaans impliciet in de generator in plaats van te worden gerepresenteerd als een inspecteerbare tussenliggende structuur. Daarentegen streeft GCE ernaar om scèneverrijking expliciet te maken op het niveau van de scenerepresentatie, terwijl de visuele gevolgen ervan tijdens de generatie worden onderzocht, met als doel gegenereerde inhoud aan te moedigen die visueel aannemelijk, structureel coherent en semantisch rijker is dan de schaarse invoer. Om GCE te implementeren, stellen we een gezamenlijk getraind adversariaal raamwerk voor dat scènegraphen verrijkt door objectsemantiek en inter-objectrelaties te modelleren. Onze benadering representeert eerst de invoerbeschrijving als een scènegraaf, waarbij knooppunten objecten modelleren en randen inter-objectrelaties vastleggen. Het raamwerk gebruikt graafconvolutionele netwerken om extra objecten en hun relaties met de bestaande scène te voorspellen. Ten slotte wordt de verrijkte scènegraaf door de stroomafwaartse beeldgeneratiepijplijn geleid om de bijbehorende visuele inhoud te genereren. We evalueren het raamwerk met proxy-scènegraafverrijkingsmetrieken, beeldkwaliteitsvergelijkingen, kwalitatieve voorbeelden en gebruikersstudies op de Visual Genome-dataset.
English
We study Generated Contents Enrichment (GCE), a conditional image-generation task in which a sparse scene description is first enriched through an explicit scene representation and then rendered into semantically richer visual content. Conventional image-generation systems can produce visually realistic outputs from limited scene descriptions, but the added content is usually implicit in the generator rather than represented as an inspectable intermediate structure. In contrast, GCE seeks to make scene enrichment explicit at the scene-representation level while examining its visual consequences during generation, with the goal of encouraging generated content that is visually plausible, structurally coherent, and semantically richer than the sparse input. To instantiate GCE, we propose a jointly trained adversarial framework that enriches scene graphs by modeling object semantics and inter-object relations. Our approach first represents the input description as a scene graph, where nodes model objects and edges capture inter-object relations. The framework uses graph convolutional networks to predict additional objects and their relations to the existing scene. Finally, the enriched scene graph is passed through the downstream image-generation pipeline to generate the corresponding visual content. We evaluate the framework with proxy scene graph enrichment metrics, image-quality comparisons, qualitative examples, and user studies on the Visual Genome dataset.