Denoising Jerárquico para el Razonamiento Visual de Múltiples Pasos
Hierarchical Denoising For Multi-Step Visual Reasoning
July 16, 2026
Autores: Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyuan Qian, Sirui Han, Shanghang Zhang
cs.AI
Resumen
Los modelos de video están evolucionando hacia modelos fundacionales de visión, pero aún carecen de un razonamiento multi-paso similar al humano. Los modelos de difusión autorregresivos en flujo continuo (*streaming*) son eficientes pero limitados en razonamiento, mientras que la difusión bidireccional permite una revisión global con altos costos de inferencia debido a la densa eliminación de ruido a nivel de fotograma. Ambos paradigmas tienen dificultades para lograr consistencia lógica y *streaming* de baja latencia en tareas de razonamiento complejo. Proponemos HDR (*Hierarchical Denoising for Visual Reasoning*), un marco unificado que integra latentes jerárquicos en la generación de video causal para razonamiento multi-paso. HDR organiza los latentes de video en una jerarquía estructurada en árbol, permitiendo un razonamiento de grueso a fino antes de la salida en *streaming*. Las capas de eliminación de ruido gruesas preservan hipótesis inciertas para la planificación global, mientras que las capas más finas las refinan progresivamente en estados visuales concretos. Un patrón de atención jerárquica disperso (*Sparse Hierarchical Attention Pattern*, SHAP) reduce aún más los costos de atención temporal. Introducimos un *benchmark* de razonamiento de video multi-paso estratificado por niveles con casos fuera de la distribución, que abarca seis tareas: navegación en laberintos, Torres de Hanói, dibujo de un solo trazo, rompecabezas deslizante, Sokoban y vertido de agua. En comparación con las líneas base de difusión autorregresiva en *streaming*, HDR mejora el éxito de 34,22 a 60,29 (76,2% de ganancia relativa) y aumenta el progreso promedio de 76,00 a 89,56, demostrando trayectorias de razonamiento más consistentes. HDR mantiene un *streaming* de baja latencia a 0,70 segundos por latente, logrando una inferencia 54,2 veces más rápida que la difusión bidireccional. También retiene el 82,9% del rendimiento con todos los datos utilizando solo el 2% de los datos de entrenamiento, en comparación con el 52,0% de la difusión bidireccional. Experimentos robóticos en el mundo real demuestran además el potencial de HDR para la interacción física y el modelado del mundo. Demostración del proyecto: https://hierarchical-diffusion-reasoning.github.io/.
English
Video models are evolving into vision foundation models, yet they still lack human-like multi-step reasoning. Streaming autoregressive diffusion models are efficient but limited in reasoning, while bidirectional diffusion enables global revision with high inference costs due to dense frame-level denoising. Both paradigms struggle to achieve logical consistency and low-latency streaming for complex reasoning tasks. We propose HDR (Hierarchical Denoising for Visual Reasoning), a unified framework that integrates hierarchical latents into causal video generation for multi-step reasoning. HDR organizes video latents into a tree-structured hierarchy, enabling coarse-to-fine reasoning before streaming output. Coarse denoising layers preserve uncertain hypotheses for global planning, while finer layers progressively refine them into concrete visual states. A sparse hierarchical attention pattern (SHAP) further reduces temporal attention costs. We introduce a level-stratified multi-step video reasoning benchmark with out-of-distribution cases, covering six tasks: maze navigation, Tower of Hanoi, one-line drawing, sliding puzzle, Sokoban, and water pouring. Compared with streaming autoregressive diffusion baselines, HDR improves success from 34.22 to 60.29 (76.2% relative gain) and increases average progress from 76.00 to 89.56, demonstrating more consistent reasoning trajectories. HDR maintains low-latency streaming at 0.70 seconds per latent, achieving 54.2 times faster inference than bidirectional diffusion. It also retains 82.9% of full-data performance with only 2% training data, compared with 52.0% for bidirectional diffusion. Real-world robot experiments further demonstrate HDR's potential for physical interaction and world modeling. Project demo: https://hierarchical-diffusion-reasoning.github.io/.