ChatPaper.aiChatPaper

Hallo4D: Снижение мультимодальных галлюцинаций для согласованной пространственно-временной генерации

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation

July 15, 2026
Авторы: Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He
cs.AI

Аннотация

Хотя недавние достижения в области 3D-генерации позволили добиться впечатляющего визуального синтеза, существующие методы часто полагаются на диффузионный контроль 2D без явных механизмов обеспечения геометрической согласованности, что приводит к пространственным галлюцинациям, таким как дублирование структур и несогласованная геометрия. Эти проблемы усугубляются в 4D-генерации, где поддержание согласованности между различными точками обзора и временной эволюцией создает дополнительные трудности, включая дрожание, мерцание идентичности и структурный дрейф. Мы представляем Hallo4D — унифицированную и модельно-независимую структуру для смягчения пространственно-временных галлюцинаций при генерации 3D и 4D контента. Hallo4D вводит парадигму «генерация-обнаружение-коррекция», которая использует большие мультимодальные языковые модели (LMM) для выявления и обобщения пространственных и временных несоответствий на основе многовидовых и многокадровых рендеров. Эти выводы направляют консенсусную оптимизацию согласованности в пространстве изображений, где селектор на основе LMM оценивает возможные коррекции посредством многомодельного голосования, не требуя переобучения или изменения архитектуры. Для дальнейшего улучшения временной согласованности и эффективности оптимизации Hallo4D включает семплирование ключевых кадров с учетом движения, инициализацию под руководством LMM и согласование внешнего вида. Кроме того, мы внедряем оптимизацию с учетом экспозиции и отбраковку видимости для повышения надежности при сложных точках обзора. Обширные эксперименты показывают, что Hallo4D стабильно превосходит сильные базовые модели в различных условиях 3D и 4D генерации, предлагая масштабируемое и обобщаемое решение для генерации контента с учетом согласованности.
English
While recent advances in 3D generation have enabled impressive visual synthesis, existing methods often rely on 2D diffusion supervision without explicit mechanisms for geometric consistency, leading to spatial hallucinations such as duplicated structures and misaligned geometry. These issues become more severe in 4D generation, where maintaining consistency across viewpoints and temporal evolution introduces additional challenges, including jitter, identity flicker, and structural drift. We present Hallo4D, a unified and model-agnostic framework for mitigating spatiotemporal hallucinations in 3D and 4D content generation. Hallo4D introduces a generation-detection-correction paradigm that leverages large multimodal language models (LMMs) to identify and summarize spatial and temporal inconsistencies from multi-view and multi-frame renderings. These insights guide a consensus-driven image-space consistency optimization, where an LMM-based selector evaluates candidate corrections through multi-model voting, without requiring retraining or architectural modifications. To further improve temporal consistency and optimization efficiency, Hallo4D incorporates motion-aware keyframe sampling, LMM-guided initialization, and appearance alignment. We additionally introduce exposure-aware optimization and visibility pruning to enhance robustness under challenging viewpoints. Extensive experiments demonstrate that Hallo4D consistently outperforms strong baselines across diverse 3D and 4D generation settings, providing a scalable and generalizable solution for consistency-aware content generation.