RigidFormer: Aprendendo Dinâmica de Corpos Rígidos com Transformadores
RigidFormer: Learning Rigid Dynamics using Transformers
May 9, 2026
Autores: Zhiyang Dou, Minghao Guo, Haixu Wu, Doug Roble, Tuur Stuyck, Wojciech Matusik
cs.AI
Resumo
A simulação baseada em aprendizado de dinâmica de corpos rígidos multiobjeto continua difícil porque o contato é descontínuo e os erros se acumulam ao longo de horizontes longos. A maioria dos métodos existentes permanece vinculada à conectividade de malha e à passagem de mensagens em nível de vértice, o que limita sua aplicabilidade a entradas livres de malha, como nuvens de pontos, e leva a alto custo computacional. Modelar eficientemente dinâmica de corpos rígidos de alta fidelidade a partir de representações livres de malha continua, portanto, desafiador. Apresentamos RigidFormer, um modelo baseado em Transformer centrado em objetos que aprende dinâmica de corpos rígidos livre de malha com tamanhos de passo de integração controláveis. RigidFormer raciocina no nível do objeto e avança cada objeto por meio de âncoras compactas; Anchor-Vertex Pooling enriquece essas âncoras com características locais de vértices, retendo geometria relevante para contato sem interação densa entre vértices. Propomos Anchor-based RoPE para injetar geometria de âncora na atenção, respeitando a natureza não ordenada de objetos e âncoras: o processamento de tokens de objeto é equivariante a permutações, e o descritor de âncora com pooling de média é invariante à reindexação de âncoras, preservando a extensão da forma. RigidFormer ainda impõe rigidez projetando atualizações no manifold de corpo rígido usando alinhamento de Kabsch diferenciável. Em benchmarks padrão, RigidFormer supera ou iguala baselines baseados em malha usando entradas de pontos, executa mais rápido, generaliza para resoluções de pontos não vistas e entre conjuntos de dados, e escala para mais de 200 objetos; também mostramos uma extensão preliminar para corpos articulados comandados por condições, tratando partes do corpo como componentes de nível de objeto que interagem.
English
Learning-based simulation of multi-object rigid-body dynamics remains difficult because contact is discontinuous and errors compound over long horizons. Most existing methods remain tied to mesh connectivity and vertex-level message passing, which limits their applicability to mesh-free inputs such as point clouds and leads to high computational cost. Efficiently modeling high-fidelity rigid-body dynamics from mesh-free representations, therefore, remains challenging. We introduce RigidFormer, an object-centric Transformer-based model that learns mesh-free rigid-body dynamics with controllable integration step sizes. RigidFormer reasons at the object level and advances each object through compact anchors; Anchor-Vertex Pooling enriches these anchors with local vertex features, retaining contact-relevant geometry without dense vertex-level interaction. We propose Anchor-based RoPE to inject anchor geometry into attention while respecting the unordered nature of objects and anchors: object-token processing is permutation-equivariant, and the mean-pooled anchor descriptor is invariant to anchor reindexing while preserving shape extent. RigidFormer further enforces rigidity by projecting updates onto the rigid-body manifold using differentiable Kabsch alignment. On standard benchmarks, RigidFormer outperforms or matches mesh-based baselines using point inputs, runs faster, generalizes to unseen point resolutions and across datasets, and scales to 200+ objects; we also show a preliminary extension to command-conditioned articulated bodies by treating body parts as interacting object-level components.