4DThinker: Pensando com Imagens 4D para a Compreensão Espacial Dinâmica
4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding
May 7, 2026
Autores: Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xiang An, Bo Li, Xin Xie, ZiDong Wang, Mingze Sun, Shuang Chen, Hongyu Li, Xiaobin Hu, Ruqi Huang
cs.AI
Resumo
Raciocínio espacial dinâmico a partir de vídeos monoculares é essencial para conectar a inteligência visual ao mundo físico, mas continua desafiador para modelos de visão-linguagem (VLMs). Abordagens anteriores ou verbalizam o raciocínio espaço-temporal inteiramente como texto, o que é inerentemente prolixo e impreciso para dinâmicas complexas, ou dependem de módulos geométricos externos que aumentam a complexidade da inferência sem fomentar a capacidade intrínseca do modelo. Neste artigo, apresentamos o 4DThinker, a primeira arquitetura que permite que VLMs "pensem em 4D" por meio de imagens mentais latentes dinâmicas, ou seja, simulando internamente como as cenas evoluem no espaço oculto contínuo. Especificamente, introduzimos primeiro um pipeline escalável e livre de anotações para geração de dados que sintetiza dados de raciocínio 4D a partir de vídeos brutos. Em seguida, propomos o Ajuste Fino de Imagens Dinâmicas (DIFT), que supervisiona conjuntamente tokens textuais e latentes 4D para fundamentar o modelo em semânticas visuais dinâmicas. Com base nisso, a Aprendizagem por Reforço 4D (4DRL) aborda tarefas de raciocínio complexas por meio de recompensas baseadas em resultados, restringindo os gradientes de política a tokens de texto para garantir otimização estável. Experimentos extensivos em múltiplos benchmarks de raciocínio espacial dinâmico demonstram que o 4DThinker supera consistentemente linhas de base fortes e oferece uma nova perspectiva para o raciocínio 4D em VLMs. Nosso código está disponível em https://github.com/zhangquanchen/4DThinker.
English
Dynamic spatial reasoning from monocular video is essential for bridging visual intelligence and the physical world, yet remains challenging for vision-language models (VLMs). Prior approaches either verbalize spatial-temporal reasoning entirely as text, which is inherently verbose and imprecise for complex dynamics, or rely on external geometric modules that increase inference complexity without fostering intrinsic model capability. In this paper, we present 4DThinker, the first framework that enables VLMs to "think with 4D" through dynamic latent mental imagery, i.e., internally simulating how scenes evolve within the continuous hidden space. Specifically, we first introduce a scalable, annotation-free data generation pipeline that synthesizes 4D reasoning data from raw videos. We then propose Dynamic-Imagery Fine-Tuning (DIFT), which jointly supervises textual tokens and 4D latents to ground the model in dynamic visual semantics. Building on this, 4D Reinforcement Learning (4DRL) further tackles complex reasoning tasks via outcome-based rewards, restricting policy gradients to text tokens to ensure stable optimization. Extensive experiments across multiple dynamic spatial reasoning benchmarks demonstrate that 4DThinker consistently outperforms strong baselines and offers a new perspective toward 4D reasoning in VLMs. Our code is available at https://github.com/zhangquanchen/4DThinker.