ChatPaper.aiChatPaper

Siga-a-Trilha: Composição de Vídeo e Controle de Movimento com Rastreamento de Pontos

Go-with-the-Track: Video Compositing and Motion Control with Point Tracking

June 18, 2026
Autores: Koichi Namekata, Yash Kant, Zhizheng Liu, Ryan D Burgert, Yuancheng Xu, Kuan Heng Lin, Emmett Steven, Julien Philip, Li Ma, Andrea Vedaldi, Paul Debevec, Ning Yu
cs.AI

Resumo

A produção cinematográfica exige controle preciso de movimento e composição de imagens de referência – capacidades que os métodos existentes tratam separadamente. Modelos de imagem para vídeo condicionados por point-tracks restringem a inserção de conteúdo ao primeiro quadro, enquanto modelos de referência para vídeo carecem de controle espaço-temporal refinado sobre como o conteúdo de referência se integra ao longo dos quadros. Apresentamos o Go-with-the-Track, que unifica ambas as capacidades ao condicionar conjuntamente múltiplas imagens de referência e point-tracks ancorados em referência – estendendo os point-tracks convencionais para estabelecer explicitamente correspondências entre quadros gerados e imagens de referência, permitindo assim composição e controle de movimento precisos ao longo do vídeo. Para isso, introduzimos embeddings de point-tracks espacialmente conscientes que codificam a sequência completa de coordenadas dos point-tracks usando um MLP coordenada a coordenada seguido de pooling temporal. Esta representação captura as características espaciais de cada point-track (servindo como um identificador único), enquanto a similaridade do embedding se correlaciona diretamente com a proximidade espacial, melhorando a capacidade do modelo de distinguir e associar point-tracks. Injetamos esses embeddings de point-tracks em um transformer de difusão de vídeo por meio de um adaptador leve, resolvendo a incompatibilidade de resolução pixel-a-patch enquanto evita a perda substancial de detalhes de movimento inerente à subamostragem ingênua de point-tracks. Utilizamos uma estratégia de treinamento híbrido para treinar conjuntamente em conjuntos de dados de vídeo de cenas dinâmicas, estáticas e sintéticas para aumentar a controlabilidade do movimento. Experimentos demonstram que o Go-with-the-Track alcança controle superior de movimento e referência em um único modelo e possibilita novas capacidades: geração de vídeo condicionada a múltiplas referências com composição orientada por point-tracks, bem como controle de câmera para cenas estáticas e dinâmicas. Página do projeto: https://eyeline-labs.github.io/Go-with-the-Track/
English
Filmmaking demands precise motion control and reference image compositing -- capabilities that existing methods treat separately. Point-track-conditioned image-to-video models restrict content insertion to the first frame, while reference-to-video models lack fine-grained spatial-temporal control over how reference content integrates across frames. We present Go-with-the-Track, which unifies both capabilities by jointly conditioning on multiple reference images and reference-anchored point-tracks -- extending conventional point-tracks to explicitly establish correspondences between generated frames and reference images, thus enabling precise compositing and motion control throughout the video. To achieve this, we introduce spatially-aware point-track embeddings that encode the full sequence of point-track coordinates using a coordinate-wise MLP followed by temporal pooling. This representation captures the spatial characteristics of each point-track (serving as a unique identifier), while the embedding similarity correlates directly with spatial proximity, enhancing the model's ability to distinguish and associate point-tracks. We inject these point-track embeddings into a video diffusion transformer via a lightweight adapter, resolving the pixel-to-patch resolution mismatch while avoiding the substantial motion detail loss inherent in naive point-track subsampling. We use a hybrid training strategy to train jointly on dynamic, static, and synthetic scene video datasets to boost motion controllability. Experiments demonstrate that Go-with-the-Track achieves superior motion and reference control in a single model and enables new capabilities: multi-reference conditioned video generation with point-track driven compositing, as well as camera control for both static and dynamic scenes. Project Page: https://eyeline-labs.github.io/Go-with-the-Track/