Hallo4D : Atténuation des hallucinations multi-modales pour une génération spatio-temporelle cohérente
Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation
July 15, 2026
Auteurs: Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He
cs.AI
Résumé
Bien que les récentes avancées en génération 3D aient permis une synthèse visuelle impressionnante, les méthodes existantes reposent souvent sur une supervision par diffusion 2D sans mécanismes explicites de cohérence géométrique, ce qui entraîne des hallucinations spatiales telles que des structures dupliquées et une géométrie désalignée. Ces problèmes deviennent plus graves dans la génération 4D, où le maintien de la cohérence entre les points de vue et l'évolution temporelle introduit des défis supplémentaires, notamment des tremblements, des scintillements d'identité et des dérives structurelles. Nous présentons Hallo4D, un cadre unifié et indépendant du modèle pour atténuer les hallucinations spatiotemporelles dans la génération de contenu 3D et 4D. Hallo4D introduit un paradigme de génération-détection-correction qui exploite les grands modèles de langage multimodaux (LMM) pour identifier et résumer les incohérences spatiales et temporelles à partir de rendus multi-vues et multi-images. Ces informations guident une optimisation de cohérence dans l'espace image basée sur le consensus, où un sélecteur basé sur LMM évalue les corrections candidates par vote multi-modèle, sans nécessiter de réentraînement ni de modifications architecturales. Pour améliorer davantage la cohérence temporelle et l'efficacité de l'optimisation, Hallo4D intègre un échantillonnage d'images clés sensible au mouvement, une initialisation guidée par LMM et un alignement d'apparence. Nous introduisons également une optimisation sensible à l'exposition et un élagage de visibilité pour renforcer la robustesse sous des points de vue difficiles. Des expériences approfondies démontrent que Hallo4D surpasse systématiquement les bases de référence solides dans divers contextes de génération 3D et 4D, offrant une solution évolutive et généralisable pour la génération de contenu tenant compte de la cohérence.
English
While recent advances in 3D generation have enabled impressive visual synthesis, existing methods often rely on 2D diffusion supervision without explicit mechanisms for geometric consistency, leading to spatial hallucinations such as duplicated structures and misaligned geometry. These issues become more severe in 4D generation, where maintaining consistency across viewpoints and temporal evolution introduces additional challenges, including jitter, identity flicker, and structural drift. We present Hallo4D, a unified and model-agnostic framework for mitigating spatiotemporal hallucinations in 3D and 4D content generation. Hallo4D introduces a generation-detection-correction paradigm that leverages large multimodal language models (LMMs) to identify and summarize spatial and temporal inconsistencies from multi-view and multi-frame renderings. These insights guide a consensus-driven image-space consistency optimization, where an LMM-based selector evaluates candidate corrections through multi-model voting, without requiring retraining or architectural modifications. To further improve temporal consistency and optimization efficiency, Hallo4D incorporates motion-aware keyframe sampling, LMM-guided initialization, and appearance alignment. We additionally introduce exposure-aware optimization and visibility pruning to enhance robustness under challenging viewpoints. Extensive experiments demonstrate that Hallo4D consistently outperforms strong baselines across diverse 3D and 4D generation settings, providing a scalable and generalizable solution for consistency-aware content generation.