ChatPaper.aiChatPaper

Hallo4D: Multimodale Halluzinationsminderung für konsistente räumlich-zeitliche Generierung

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation

July 15, 2026
Autoren: Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He
cs.AI

Zusammenfassung

Während jüngste Fortschritte in der 3D-Generierung eine beeindruckende visuelle Synthese ermöglicht haben, stützen sich bestehende Methoden oft auf 2D-Diffusionsüberwachung ohne explizite Mechanismen für geometrische Konsistenz, was zu räumlichen Halluzinationen wie duplizierten Strukturen und fehlausgerichteter Geometrie führt. Diese Probleme verschärfen sich bei der 4D-Generierung, wo die Aufrechterhaltung der Konsistenz über Blickwinkel und zeitliche Entwicklung hinweg zusätzliche Herausforderungen mit sich bringt, darunter Ruckeln, Identitätsflimmern und strukturelle Drift. Wir präsentieren Hallo4D, ein einheitliches und modellagnostisches Framework zur Minderung räumlich-zeitlicher Halluzinationen in der 3D- und 4D-Inhaltsgenerierung. Hallo4D führt ein Generierungs-Detektions-Korrektur-Paradigma ein, das große multimodale Sprachmodelle (LMMs) nutzt, um räumliche und zeitliche Inkonsistenzen aus Multi-View- und Multi-Frame-Renderings zu identifizieren und zusammenzufassen. Diese Erkenntnisse leiten eine konsensgesteuerte Bildraum-Konsistenzoptimierung, bei der ein LMM-basierter Selektor Kandidatenkorrekturen durch Multi-Modell-Abstimmung bewertet, ohne dass ein erneutes Training oder architektonische Änderungen erforderlich sind. Um die zeitliche Konsistenz und Optimierungseffizienz weiter zu verbessern, integriert Hallo4D bewegungsbewusstes Keyframe-Sampling, LMM-gesteuerte Initialisierung und Erscheinungsbildabgleich. Zusätzlich führen wir belichtungsbewusste Optimierung und Sichtbarkeitsbeschneidung ein, um die Robustheit unter herausfordernden Blickwinkeln zu erhöhen. Umfangreiche Experimente zeigen, dass Hallo4D durchgängig starke Basislinien in verschiedenen 3D- und 4D-Generierungseinstellungen übertrifft und eine skalierbare und generalisierbare Lösung für konsistenzbewusste Inhaltsgenerierung bietet.
English
While recent advances in 3D generation have enabled impressive visual synthesis, existing methods often rely on 2D diffusion supervision without explicit mechanisms for geometric consistency, leading to spatial hallucinations such as duplicated structures and misaligned geometry. These issues become more severe in 4D generation, where maintaining consistency across viewpoints and temporal evolution introduces additional challenges, including jitter, identity flicker, and structural drift. We present Hallo4D, a unified and model-agnostic framework for mitigating spatiotemporal hallucinations in 3D and 4D content generation. Hallo4D introduces a generation-detection-correction paradigm that leverages large multimodal language models (LMMs) to identify and summarize spatial and temporal inconsistencies from multi-view and multi-frame renderings. These insights guide a consensus-driven image-space consistency optimization, where an LMM-based selector evaluates candidate corrections through multi-model voting, without requiring retraining or architectural modifications. To further improve temporal consistency and optimization efficiency, Hallo4D incorporates motion-aware keyframe sampling, LMM-guided initialization, and appearance alignment. We additionally introduce exposure-aware optimization and visibility pruning to enhance robustness under challenging viewpoints. Extensive experiments demonstrate that Hallo4D consistently outperforms strong baselines across diverse 3D and 4D generation settings, providing a scalable and generalizable solution for consistency-aware content generation.