ChatPaper.aiChatPaper

Réutilisation de modèles génératifs 3D pour la génération de mises en page autorégressive

Repurposing 3D Generative Model for Autoregressive Layout Generation

April 17, 2026
Auteurs: Haoran Feng, Yifan Niu, Zehuan Huang, Yang-Tian Sun, Chunchao Guo, Yuxin Peng, Lu Sheng
cs.AI

Résumé

Nous présentons LaviGen, un cadre qui réutilise des modèles génératifs 3D pour la génération de dispositions 3D. Contrairement aux méthodes antérieures qui infèrent les agencements d'objets à partir de descriptions textuelles, LaviGen opère directement dans l'espace 3D natif, formulant la génération de disposition comme un processus autorégressif qui modélise explicitement les relations géométriques et les contraintes physiques entre les objets, produisant ainsi des scènes 3D cohérentes et physiquement plausibles. Pour améliorer davantage ce processus, nous proposons un modèle de diffusion 3D adapté qui intègre les informations de scène, d'objet et d'instruction, et emploie un mécanisme de distillation par auto-déploiement à double guidage pour accroître l'efficacité et la précision spatiale. Des expériences approfondies sur le benchmark LayoutVLM montrent que LaviGen atteint des performances supérieures en génération de dispositions 3D, avec une plausibilité physique 19 % plus élevée que l'état de l'art et un calcul 65 % plus rapide. Notre code est disponible publiquement à l'adresse https://github.com/fenghora/LaviGen.
English
We introduce LaviGen, a framework that repurposes 3D generative models for 3D layout generation. Unlike previous methods that infer object layouts from textual descriptions, LaviGen operates directly in the native 3D space, formulating layout generation as an autoregressive process that explicitly models geometric relations and physical constraints among objects, producing coherent and physically plausible 3D scenes. To further enhance this process, we propose an adapted 3D diffusion model that integrates scene, object, and instruction information and employs a dual-guidance self-rollout distillation mechanism to improve efficiency and spatial accuracy. Extensive experiments on the LayoutVLM benchmark show LaviGen achieves superior 3D layout generation performance, with 19% higher physical plausibility than the state of the art and 65% faster computation. Our code is publicly available at https://github.com/fenghora/LaviGen.