Quando os Modelos de Difusão Aprendem a Gerar Múltiplos Objetos?
When Do Diffusion Models learn to Generate Multiple Objects?
April 30, 2026
Autores: Yujin Jeong, Arnas Uselis, Iro Laina, Seong Joon Oh, Anna Rohrbach
cs.AI
Resumo
Os modelos de difusão texto-imagem alcançam uma fidelidade visual impressionante, mas permanecem pouco confiáveis na geração de múltiplos objetos. Apesar de extensas evidências empíricas dessas falhas, as causas subjacentes permanecem pouco claras. Começamos por questionar o quanto dessa limitação surge dos próprios dados. Para isolar os efeitos dos dados, consideramos dois regimes em diferentes tamanhos de conjuntos de dados: (1) generalização de conceitos, onde cada conceito individual é observado durante o treinamento sob distribuições de dados potencialmente desequilibradas, e (2) generalização composicional, onde combinações específicas de conceitos são sistematicamente excluídas (held-out). Para estudar esses regimes, introduzimos o MOSAIC (Multi-Object Spatial relations, AttrIbution, Counting), uma estrutura controlada para geração de conjuntos de dados. Ao treinar modelos de difusão no MOSAIC, descobrimos que a complexidade da cena desempenha um papel dominante, e não o desequilíbrio de conceitos, e que a contagem é singularmente difícil de aprender em regimes de poucos dados. Além disso, a generalização composicional entra em colapso à medida que mais combinações de conceitos são excluídas durante o treinamento. Essas descobertas destacam limitações fundamentais dos modelos de difusão e motivam vieses indutivos mais fortes e um design de dados mais robusto para a geração composicional de múltiplos objetos.
English
Text-to-image diffusion models achieve impressive visual fidelity, yet they remain unreliable in multi-object generation. Despite extensive empirical evidence of these failures, the underlying causes remain unclear. We begin by asking how much of this limitation arises from the data itself. To disentangle data effects, we consider two regimes across different dataset sizes: (1) concept generalization, where each individual concept is observed during training under potentially imbalanced data distributions, and (2) compositional generalization, where specific combinations of concepts are systematically held out. To study these regimes, we introduce mosaic (Multi-Object Spatial relations, AttrIbution, Counting), a controlled framework for dataset generation. By training diffusion models on mosaic, we find that scene complexity plays a dominant role rather than concept imbalance, and that counting is uniquely difficult to learn in low-data regimes. Moreover, compositional generalization collapses as more concept combinations are held out during training. These findings highlight fundamental limitations of diffusion models and motivate stronger inductive biases and data design for robust multi-object compositional generation.