マルチステップ視覚推論のための階層的ノイズ除去
Hierarchical Denoising For Multi-Step Visual Reasoning
July 16, 2026
著者: Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyuan Qian, Sirui Han, Shanghang Zhang
cs.AI
要旨
ビデオモデルは視覚基盤モデルへと進化しつつあるが、人間のような多段階推論は依然として欠如している。ストリーミング自己回帰拡散モデルは効率的だが推論に限界があり、一方双方向拡散はフレーム単位の高密度なノイズ除去により高い推論コストを伴うが、グローバルな修正を可能にする。両パラダイムとも、複雑な推論タスクにおいて論理的一貫性と低遅延ストリーミングを達成するのが困難である。本稿では、階層的潜在変数を因果的ビデオ生成に統合し、多段階推論を実現する統一フレームワークHDR(Hierarchical Denoising for Visual Reasoning、視覚的推論のための階層的ノイズ除去)を提案する。HDRはビデオの潜在変数を木構造の階層に編成し、ストリーミング出力前に粗密の推論を可能にする。粗いノイズ除去層は不確かな仮説を保持してグローバルな計画を立て、細かい層がそれらを段階的に具体的な視覚状態に洗練する。さらに、スパース階層的注意パターン(SHAP)により時間的注意のコストを削減する。我々は、分布外のケースを含む、迷路ナビゲーション、ハノイの塔、一筆書き、スライディングパズル、倉庫番、水注ぎの6タスクをカバーする、レベル別多段階ビデオ推論ベンチマークを導入する。ストリーミング自己回帰拡散ベースラインと比較して、HDRは成功率を34.22から60.29(76.2%の相対向上)に改善し、平均進捗を76.00から89.56に向上させ、より一貫した推論軌跡を示す。HDRは潜在変数あたり0.70秒の低遅延ストリーミングを維持し、双方向拡散と比較して54.2倍高速な推論を達成する。また、訓練データの2%のみで全データ性能の82.9%を保持し、双方向拡散の52.0%を上回る。実世界のロボット実験は、物理的相互作用と世界モデリングにおけるHDRの可能性をさらに示している。プロジェクトデモ:https://hierarchical-diffusion-reasoning.github.io/。
English
Video models are evolving into vision foundation models, yet they still lack human-like multi-step reasoning. Streaming autoregressive diffusion models are efficient but limited in reasoning, while bidirectional diffusion enables global revision with high inference costs due to dense frame-level denoising. Both paradigms struggle to achieve logical consistency and low-latency streaming for complex reasoning tasks. We propose HDR (Hierarchical Denoising for Visual Reasoning), a unified framework that integrates hierarchical latents into causal video generation for multi-step reasoning. HDR organizes video latents into a tree-structured hierarchy, enabling coarse-to-fine reasoning before streaming output. Coarse denoising layers preserve uncertain hypotheses for global planning, while finer layers progressively refine them into concrete visual states. A sparse hierarchical attention pattern (SHAP) further reduces temporal attention costs. We introduce a level-stratified multi-step video reasoning benchmark with out-of-distribution cases, covering six tasks: maze navigation, Tower of Hanoi, one-line drawing, sliding puzzle, Sokoban, and water pouring. Compared with streaming autoregressive diffusion baselines, HDR improves success from 34.22 to 60.29 (76.2% relative gain) and increases average progress from 76.00 to 89.56, demonstrating more consistent reasoning trajectories. HDR maintains low-latency streaming at 0.70 seconds per latent, achieving 54.2 times faster inference than bidirectional diffusion. It also retains 82.9% of full-data performance with only 2% training data, compared with 52.0% for bidirectional diffusion. Real-world robot experiments further demonstrate HDR's potential for physical interaction and world modeling. Project demo: https://hierarchical-diffusion-reasoning.github.io/.