Hallo4D: Mitigación de alucinaciones multimodales para la generación espacio-temporal consistente
Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation
July 15, 2026
Autores: Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He
cs.AI
Resumen
Si bien los avances recientes en la generación 3D han permitido una impresionante síntesis visual, los métodos existentes a menudo dependen de la supervisión de difusión 2D sin mecanismos explícitos para la consistencia geométrica, lo que genera alucinaciones espaciales como estructuras duplicadas y geometría desalineada. Estos problemas se vuelven más graves en la generación 4D, donde mantener la consistencia entre puntos de vista y la evolución temporal introduce desafíos adicionales, como fluctuación, parpadeo de identidad y deriva estructural. Presentamos Hallo4D, un marco unificado e independiente del modelo para mitigar alucinaciones espacio-temporales en la generación de contenido 3D y 4D. Hallo4D introduce un paradigma de generación-detección-corrección que aprovecha modelos de lenguaje multimodales grandes (LMM) para identificar y resumir inconsistencias espaciales y temporales a partir de representaciones multivista y multifotograma. Estos conocimientos guían una optimización de consistencia en el espacio de imagen impulsada por consenso, donde un selector basado en LMM evalúa correcciones candidatas mediante votación entre múltiples modelos, sin requerir reentrenamiento ni modificaciones arquitectónicas. Para mejorar aún más la consistencia temporal y la eficiencia de optimización, Hallo4D incorpora muestreo de fotogramas clave consciente del movimiento, inicialización guiada por LMM y alineación de apariencia. Además, introducimos optimización consciente de la exposición y poda de visibilidad para mejorar la robustez en puntos de vista desafiantes. Extensos experimentos demuestran que Hallo4D supera consistentemente a líneas base sólidas en diversas configuraciones de generación 3D y 4D, proporcionando una solución escalable y generalizable para la generación de contenido consciente de la consistencia.
English
While recent advances in 3D generation have enabled impressive visual synthesis, existing methods often rely on 2D diffusion supervision without explicit mechanisms for geometric consistency, leading to spatial hallucinations such as duplicated structures and misaligned geometry. These issues become more severe in 4D generation, where maintaining consistency across viewpoints and temporal evolution introduces additional challenges, including jitter, identity flicker, and structural drift. We present Hallo4D, a unified and model-agnostic framework for mitigating spatiotemporal hallucinations in 3D and 4D content generation. Hallo4D introduces a generation-detection-correction paradigm that leverages large multimodal language models (LMMs) to identify and summarize spatial and temporal inconsistencies from multi-view and multi-frame renderings. These insights guide a consensus-driven image-space consistency optimization, where an LMM-based selector evaluates candidate corrections through multi-model voting, without requiring retraining or architectural modifications. To further improve temporal consistency and optimization efficiency, Hallo4D incorporates motion-aware keyframe sampling, LMM-guided initialization, and appearance alignment. We additionally introduce exposure-aware optimization and visibility pruning to enhance robustness under challenging viewpoints. Extensive experiments demonstrate that Hallo4D consistently outperforms strong baselines across diverse 3D and 4D generation settings, providing a scalable and generalizable solution for consistency-aware content generation.