MACRO: Vooruitgang in multi-referentie beeldgeneratie met gestructureerde lange-context gegevens
MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data
March 26, 2026
Auteurs: Zhekai Chen, Yuqing Wang, Manyuan Zhang, Xihui Liu
cs.AI
Samenvatting
Het genereren van beelden op basis van meerdere visuele referenties is cruciaal voor real-world toepassingen zoals composities met meerdere onderwerpen, narratieve illustratie en novel view synthesis. Toch lijden huidige modellen onder een ernstige prestatievermindering naarmate het aantal invoerreferenties toeneemt. Wij identificeren de hoofdoorzaak als een fundamenteel dataknelpunt: bestaande datasets worden gedomineerd door paren met één of enkele referenties en missen de gestructureerde, langetermijnsupervisie die nodig is om dichte onderlinge afhankelijkheden tussen referenties te leren. Om dit aan te pakken, introduceren wij MacroData, een grootschalige dataset van 400K samples, elk met maximaal 10 referentiebeelden, systematisch georganiseerd langs vier complementaire dimensies – Customization, Illustratie, Ruimtelijk redeneren en Temporele dynamiek – om een uitgebreide dekking van de multi-referentiegeneratieruimte te bieden. Erkennend dat er tegelijkertijd een gebrek is aan gestandaardiseerde evaluatieprotocollen, stellen wij verder MacroBench voor, een benchmark van 4.000 samples die de generatieve coherentie beoordeelt over gegradeerde taakdimensies en invoerschalen. Uitgebreide experimenten tonen aan dat fine-tuning op MacroData aanzienlijke verbeteringen oplevert in multi-referentiegeneratie, en ablatiestudies onthullen verder synergetische voordelen van cross-task co-training en effectieve strategieën voor het omgaan met langetermijncomplexiteit. De dataset en benchmark zullen openbaar worden vrijgegeven.
English
Generating images conditioned on multiple visual references is critical for real-world applications such as multi-subject composition, narrative illustration, and novel view synthesis, yet current models suffer from severe performance degradation as the number of input references grows. We identify the root cause as a fundamental data bottleneck: existing datasets are dominated by single- or few-reference pairs and lack the structured, long-context supervision needed to learn dense inter-reference dependencies. To address this, we introduce MacroData, a large-scale dataset of 400K samples, each containing up to 10 reference images, systematically organized across four complementary dimensions -- Customization, Illustration, Spatial reasoning, and Temporal dynamics -- to provide comprehensive coverage of the multi-reference generation space. Recognizing the concurrent absence of standardized evaluation protocols, we further propose MacroBench, a benchmark of 4,000 samples that assesses generative coherence across graded task dimensions and input scales. Extensive experiments show that fine-tuning on MacroData yields substantial improvements in multi-reference generation, and ablation studies further reveal synergistic benefits of cross-task co-training and effective strategies for handling long-context complexity. The dataset and benchmark will be publicly released.