ChatPaper.aiChatPaper

TT4D: Um Pipeline e Conjunto de Dados para Reconstrução 4D de Tênis de Mesa a Partir de Vídeos Monoculares

TT4D: A Pipeline and Dataset for Table Tennis 4D Reconstruction From Monocular Videos

May 2, 2026
Autores: Nima Rahmanian, Daniel Kienzle, Thomas Gossard, Dvij Kalaria, Rainer Lienhart, Shankar Sastry
cs.AI

Resumo

Apresentamos o TT4D, um conjunto de dados de tênis de mesa em larga escala e alta fidelidade. Ele fornece mais de 140 horas de partidas individuais e em duplas reconstruídas a partir de vídeos de transmissão monoculares, apresentando anotações multimodais, como calibrações de câmera de alta qualidade, posições 3D precisas da bola, efeito (spin) da bola, segmentação temporal e malhas humanas 3D ao longo do tempo. Esses dados ricos fornecem uma nova base para repetição virtual, análise aprofundada de jogadores e aprendizado de robôs. A combinação de escala e precisão do conjunto de dados é alcançada por meio de um novo *pipeline* de reconstrução. Métodos anteriores primeiro particionam uma sequência de jogo em segmentos de rebatidas individuais com base no rastreamento 2D da bola, e só então tentam a reconstrução. No entanto, a segmentação temporal baseada em 2D falha sob oclusão e pontos de vista variados da câmera, impedindo uma reconstrução confiável. Invertemos esse paradigma, primeiro elevando todo o rastreamento 2D não segmentado da bola para 3D por meio de uma rede neural de elevação (*lifting network*). Esta trajetória 3D nos permite então realizar a segmentação temporal de forma confiável. A rede de elevação também infere o efeito (spin) da bola, lida com detecções de bola não confiáveis e reconstrói com sucesso a trajetória da bola em casos de alta oclusão. Este design de "elevar primeiro" é necessário, pois nosso *pipeline* é o único método capaz de reconstruir partidas de tênis de mesa a partir de vídeos monoculares de transmissão com visão geral. Demonstramos a fidelidade do conjunto de dados por meio de duas tarefas subsequentes: estimar a pose e a velocidade da raquete no momento do impacto e treinar um modelo generativo de rallies competitivos.
English
We present TT4D, a large-scale, high-fidelity table tennis dataset. It provides 140+ hours of reconstructed singles and doubles gameplay from monocular broadcast videos, featuring multimodal annotations like high-quality camera calibrations, precise 3D ball positions, ball spin, time segmentation, and 3D human meshes over time. This rich data provides a new foundation for virtual replay, in-depth player analysis, and robot learning. The dataset's combination of scale and precision is achieved through a novel reconstruction pipeline. Prior methods first partition a game sequence into individual shot segments based on the 2D ball track, and only then attempt reconstruction. However, 2D-based time segmentation collapses under occlusion and varied camera viewpoints, preventing reliable reconstruction. We invert this paradigm by first lifting the entire unsegmented 2D ball track to 3D through a learned lifting network. This 3D trajectory then allows us to reliably perform time segmentation. The learned lifting network also infers the ball's spin, handles unreliable ball detections, and successfully reconstructs the ball trajectory in cases of high occlusion. This lift-first design is necessary, as our pipeline is the only method capable of reconstructing table tennis gameplay from general-view broadcast monocular videos. We demonstrate the dataset's fidelity through two downstream tasks: estimating the racket's pose \& velocity at impact, and training a generative model of competitive rallies.