ChatPaper.aiChatPaper

LooseControlVideo: Controle de Vídeo Direcional usando Bloqueio Espacial

LooseControlVideo: Directorial Video Control using Spatial Blocking

June 17, 2026
Autores: Shariq Farooq Bhat, Niloy J. Mitra, Kalyan Sunkavalli
cs.AI

Resumo

A orquestração espacial 3D precisa na geração de texto para vídeo continua sendo um desafio significativo, particularmente para cenas com múltiplos objetos, onde o layout semântico e as dinâmicas temporais frequentemente se entrelaçam. Embora os modelos existentes condicionados à profundidade alcancem boa fidelidade estrutural, eles exigem uma orientação densa e precisa por quadro, cuja criação é trabalhosa para eventos dinâmicos envolvendo objetos deformáveis. Apresentamos o LooseControlVideo, uma estrutura que permite controle intuitivo e expressivo ao usar caixas 3D orientadas e esparsas como um proxy de "bloqueio". Isso permite que os usuários definam layout e trajetória de alto nível enquanto aproveitam um modelo generativo de vídeo para gerar oclusões, dinâmicas e interações realistas. Alcançamos isso por meio do ajuste fino de uma rede base Wan 2.2 em um conjunto de dados de vídeo anotado com DNOCS, uma nova codificação para tamanho 3D, orientação e oclusões ordenadas por profundidade. Além disso, nosso método permite refinamento localizado, como ajustar uma trajetória de salto ou adicionar uma interação, com mínima perturbação do contexto global da cena. Avaliações extensas nos benchmarks nuScenes, HO-3D e BEHAVE demonstram que o LooseControlVideo supera significativamente as baselines existentes baseadas em caixas 2D e fluxo. Nossos achados indicam uma melhoria de 1,2x a 3x no Erro de Trajetória; melhoria de 2x na Consistência de Movimento Rígido; e um aumento de 1,5x a 2x na Precisão de Oclusão em relação aos modelos de última geração condicionados a layout, demonstrando que primitivas 3D orientadas fornecem um bom prior geométrico para a criação complexa de vídeos com múltiplos agentes.
English
Precise 3D spatial orchestration in text-to-video generation remains a significant challenge, particularly for multi-object scenes where semantic layout and temporal dynamics are often entangled. While existing depth-conditioned models achieve good structural fidelity, they necessitate dense, frame-accurate guidance that is labor-intensive to author for dynamic events involving deformable objects. We present LooseControlVideo, a framework that enables intuitive and expressive control by using sparse, oriented 3D boxes as a "blocking" proxy. This allows users to author high-level layout and trajectory while leveraging a video generative model to generate realistic occlusions, dynamics and interactions. We achieve this by fine-tuning a Wan 2.2 backbone on a video dataset annotated with DNOCS, a novel encoding for 3D size, orientation and depth-ordered occlusions. Furthermore, our method allows for localized refinement, such as adjusting a jump trajectory or adding an interaction, with minimal disruption to the global scene context. Extensive evaluations on the nuScenes, HO-3D, and BEHAVE benchmarks demonstrate that LooseControlVideo significantly outperforms existing 2D-box and flow-based baselines. Our findings indicate a 1.2x to 3x improvement in Trajectory Error; 2x improvement in Rigid Motion Consistency; and a 1.5x to 2x increase in Occlusion Accuracy over current state-of-the-art layout-conditioned models, demonstrating that oriented 3D primitives provide good geometric prior for complex, multi-agent video authoring.