ChatPaper.aiChatPaper

Hallo4D: Mitigação de Alucinações Multimodais para Geração Espaço-Temporal Consistente

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation

July 15, 2026
Autores: Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He
cs.AI

Resumo

Embora avanços recentes em geração 3D tenham possibilitado síntese visual impressionante, métodos existentes frequentemente dependem de supervisão de difusão 2D sem mecanismos explícitos para consistência geométrica, levando a alucinações espaciais, como estruturas duplicadas e geometria desalinhada. Esses problemas tornam-se mais severos na geração 4D, onde manter consistência entre pontos de vista e evolução temporal introduz desafios adicionais, incluindo tremor, oscilação de identidade e deriva estrutural. Apresentamos Hallo4D, uma estrutura unificada e independente de modelo para mitigar alucinações espaço-temporais na geração de conteúdo 3D e 4D. Hallo4D introduz um paradigma de geração-detecção-correção que aproveita modelos de linguagem multimodal grandes (LMMs) para identificar e resumir inconsistências espaciais e temporais a partir de renderizações multi-visão e multi-quadro. Essas percepções orientam uma otimização de consistência no espaço de imagem conduzida por consenso, onde um seletor baseado em LMM avalia correções candidatas por meio de votação multi-modelo, sem exigir retreinamento ou modificações arquitetônicas. Para melhorar ainda mais a consistência temporal e a eficiência da otimização, Hallo4D incorpora amostragem de quadros-chave ciente de movimento, inicialização guiada por LMM e alinhamento de aparência. Introduzimos adicionalmente otimização ciente de exposição e poda de visibilidade para aumentar a robustez sob pontos de vista desafiadores. Experimentos extensivos demonstram que Hallo4D supera consistentemente bases de referência fortes em diversas configurações de geração 3D e 4D, fornecendo uma solução escalável e generalizável para geração de conteúdo com consciência de consistência.
English
While recent advances in 3D generation have enabled impressive visual synthesis, existing methods often rely on 2D diffusion supervision without explicit mechanisms for geometric consistency, leading to spatial hallucinations such as duplicated structures and misaligned geometry. These issues become more severe in 4D generation, where maintaining consistency across viewpoints and temporal evolution introduces additional challenges, including jitter, identity flicker, and structural drift. We present Hallo4D, a unified and model-agnostic framework for mitigating spatiotemporal hallucinations in 3D and 4D content generation. Hallo4D introduces a generation-detection-correction paradigm that leverages large multimodal language models (LMMs) to identify and summarize spatial and temporal inconsistencies from multi-view and multi-frame renderings. These insights guide a consensus-driven image-space consistency optimization, where an LMM-based selector evaluates candidate corrections through multi-model voting, without requiring retraining or architectural modifications. To further improve temporal consistency and optimization efficiency, Hallo4D incorporates motion-aware keyframe sampling, LMM-guided initialization, and appearance alignment. We additionally introduce exposure-aware optimization and visibility pruning to enhance robustness under challenging viewpoints. Extensive experiments demonstrate that Hallo4D consistently outperforms strong baselines across diverse 3D and 4D generation settings, providing a scalable and generalizable solution for consistency-aware content generation.