ChatPaper.aiChatPaper

Hiërarchische Ruisonderdrukking voor Meerstaps Visuele Redenering

Hierarchical Denoising For Multi-Step Visual Reasoning

July 16, 2026
Auteurs: Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyuan Qian, Sirui Han, Shanghang Zhang
cs.AI

Samenvatting

Videomodellen evolueren naar visie-fundamentmodellen, maar ze missen nog steeds mensachtige meerstapsredenering. Streaming autoregressieve diffusiemodellen zijn efficiënt maar beperkt in redenering, terwijl bidirectionele diffusie wereldwijde revisie mogelijk maakt met hoge inferentiekosten door dichte denoising op frameniveau. Beide paradigma's hebben moeite met het bereiken van logische consistentie en streaming met lage latentie voor complexe redeneertaken. Wij stellen HDR (Hiërarchische Denoising voor Visuele Redenering) voor, een uniform raamwerk dat hiërarchische latenten integreert in causale videogeneratie voor meerstapsredenering. HDR organiseert videolaten in een boomstructuurhiërarchie, waardoor grof-naar-fijn redeneren mogelijk is voordat de streaming-output plaatsvindt. Grove denoisinglagen behouden onzekere hypothesen voor wereldwijde planning, terwijl fijnere lagen deze geleidelijk verfijnen tot concrete visuele toestanden. Een spaarzaam hiërarchisch aandachtsmechanisme (SHAP) verlaagt verder de temporele aandachtskosten. Wij introduceren een niveau-gestratificeerde meerstaps video-redeneringsbenchmark met out-of-distribution-gevallen, die zes taken omvat: doolhofnavigatie, Toren van Hanoi, eenlijnstekening, schuifpuzzel, Sokoban en watergieten. Vergeleken met streaming autoregressieve diffusiebaselines verbetert HDR het succes van 34,22 naar 60,29 (een relatieve winst van 76,2%) en verhoogt het de gemiddelde voortgang van 76,00 naar 89,56, wat meer consistente redeneringstrajecten aantoont. HDR handhaaft streaming met lage latentie van 0,70 seconden per latent, wat 54,2 keer snellere inferentie oplevert dan bidirectionele diffusie. Het behoudt ook 82,9% van de volledige dataprestaties met slechts 2% trainingsgegevens, vergeleken met 52,0% voor bidirectionele diffusie. Robotexperimenten in de echte wereld tonen verder het potentieel van HDR voor fysieke interactie en wereldmodellering aan. Projectdemo: https://hierarchical-diffusion-reasoning.github.io/.
English
Video models are evolving into vision foundation models, yet they still lack human-like multi-step reasoning. Streaming autoregressive diffusion models are efficient but limited in reasoning, while bidirectional diffusion enables global revision with high inference costs due to dense frame-level denoising. Both paradigms struggle to achieve logical consistency and low-latency streaming for complex reasoning tasks. We propose HDR (Hierarchical Denoising for Visual Reasoning), a unified framework that integrates hierarchical latents into causal video generation for multi-step reasoning. HDR organizes video latents into a tree-structured hierarchy, enabling coarse-to-fine reasoning before streaming output. Coarse denoising layers preserve uncertain hypotheses for global planning, while finer layers progressively refine them into concrete visual states. A sparse hierarchical attention pattern (SHAP) further reduces temporal attention costs. We introduce a level-stratified multi-step video reasoning benchmark with out-of-distribution cases, covering six tasks: maze navigation, Tower of Hanoi, one-line drawing, sliding puzzle, Sokoban, and water pouring. Compared with streaming autoregressive diffusion baselines, HDR improves success from 34.22 to 60.29 (76.2% relative gain) and increases average progress from 76.00 to 89.56, demonstrating more consistent reasoning trajectories. HDR maintains low-latency streaming at 0.70 seconds per latent, achieving 54.2 times faster inference than bidirectional diffusion. It also retains 82.9% of full-data performance with only 2% training data, compared with 52.0% for bidirectional diffusion. Real-world robot experiments further demonstrate HDR's potential for physical interaction and world modeling. Project demo: https://hierarchical-diffusion-reasoning.github.io/.