Иерархическое шумоподавление для многошагового визуального рассуждения
Hierarchical Denoising For Multi-Step Visual Reasoning
July 16, 2026
Авторы: Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyuan Qian, Sirui Han, Shanghang Zhang
cs.AI
Аннотация
Видеомодели эволюционируют в фундаментальные модели зрения, однако им по-прежнему не хватает многошаговых рассуждений, свойственных человеку. Потоковые авторегрессионные диффузионные модели эффективны, но ограничены в способности к рассуждению, в то время как двунаправленная диффузия обеспечивает глобальное пересмотрение, но требует высоких вычислительных затрат на инференс из-за плотного покадрового шумоподавления. Обе парадигмы не способны достичь логической согласованности и низкой задержки при потоковой обработке для сложных задач рассуждения. Мы предлагаем HDR (Иерархическое Шумоподавление для Визуального Рассуждения) — унифицированную структуру, интегрирующую иерархические скрытые переменные в каузальную генерацию видео для многошаговых рассуждений. HDR организует скрытые переменные видео в древовидную иерархию, обеспечивая рассуждение от общего к частному перед потоковым выводом. Грубые слои шумоподавления сохраняют неопределенные гипотезы для глобального планирования, в то время как более тонкие слои постепенно уточняют их до конкретных визуальных состояний. Разреженный иерархический паттерн внимания (РИПВ) дополнительно снижает затраты на временное внимание. Мы вводим стратифицированный по уровням бенчмарк для многошаговых видеорассуждений с случаями вне распределения, охватывающий шесть задач: навигация в лабиринте, Ханойская башня, рисование одной линией, игра в пятнашки, Сокобан и переливание воды. По сравнению с потоковыми авторегрессионными диффузионными базовыми моделями, HDR повышает успешность с 34,22 до 60,29 (относительный прирост 76,2%) и увеличивает средний прогресс с 76,00 до 89,56, демонстрируя более согласованные траектории рассуждения. HDR поддерживает потоковую передачу с низкой задержкой — 0,70 секунды на скрытую переменную, что обеспечивает в 54,2 раза более быстрый инференс по сравнению с двунаправленной диффузией. При использовании только 2% обучающих данных HDR сохраняет 82,9% производительности от полного набора данных, тогда как двунаправленная диффузия — лишь 52,0%. Эксперименты с реальными роботами дополнительно демонстрируют потенциал HDR для физического взаимодействия и моделирования мира. Демонстрация проекта: https://hierarchical-diffusion-reasoning.github.io/.
English
Video models are evolving into vision foundation models, yet they still lack human-like multi-step reasoning. Streaming autoregressive diffusion models are efficient but limited in reasoning, while bidirectional diffusion enables global revision with high inference costs due to dense frame-level denoising. Both paradigms struggle to achieve logical consistency and low-latency streaming for complex reasoning tasks. We propose HDR (Hierarchical Denoising for Visual Reasoning), a unified framework that integrates hierarchical latents into causal video generation for multi-step reasoning. HDR organizes video latents into a tree-structured hierarchy, enabling coarse-to-fine reasoning before streaming output. Coarse denoising layers preserve uncertain hypotheses for global planning, while finer layers progressively refine them into concrete visual states. A sparse hierarchical attention pattern (SHAP) further reduces temporal attention costs. We introduce a level-stratified multi-step video reasoning benchmark with out-of-distribution cases, covering six tasks: maze navigation, Tower of Hanoi, one-line drawing, sliding puzzle, Sokoban, and water pouring. Compared with streaming autoregressive diffusion baselines, HDR improves success from 34.22 to 60.29 (76.2% relative gain) and increases average progress from 76.00 to 89.56, demonstrating more consistent reasoning trajectories. HDR maintains low-latency streaming at 0.70 seconds per latent, achieving 54.2 times faster inference than bidirectional diffusion. It also retains 82.9% of full-data performance with only 2% training data, compared with 52.0% for bidirectional diffusion. Real-world robot experiments further demonstrate HDR's potential for physical interaction and world modeling. Project demo: https://hierarchical-diffusion-reasoning.github.io/.