ChatPaper.aiChatPaper

RigidFormer : Apprentissage de la dynamique rigide à l'aide de transformeurs

RigidFormer: Learning Rigid Dynamics using Transformers

May 9, 2026
Auteurs: Zhiyang Dou, Minghao Guo, Haixu Wu, Doug Roble, Tuur Stuyck, Wojciech Matusik
cs.AI

Résumé

La simulation basée sur l'apprentissage de la dynamique rigide multi-objets reste difficile en raison de la discontinuité des contacts et de l'accumulation des erreurs sur de long horizons temporels. La plupart des méthodes existantes restent liées à la connectivité des maillages et à la transmission de messages au niveau des sommets, ce qui limite leur applicabilité à des entrées sans maillage, comme les nuages de points, et entraîne un coût computationnel élevé. Modéliser efficacement une dynamique rigide haute fidélité à partir de représentations sans maillage demeure donc un défi. Nous présentons RigidFormer, un modèle centré sur les objets et basé sur un Transformer, qui apprend la dynamique rigide sans maillage avec des pas d'intégration contrôlables. RigidFormer raisonne au niveau des objets et fait évoluer chaque objet via des ancres compactes ; l'Anchor-Vertex Pooling enrichit ces ancres avec des caractéristiques locales des sommets, préservant ainsi la géométrie pertinente pour les contacts sans nécessiter d'interaction dense au niveau des sommets. Nous proposons l'Anchor-based RoPE pour intégrer la géométrie des ancres dans l'attention tout en respectant la nature non ordonnée des objets et des ancres : le traitement des tokens d'objets est équivariant aux permutations, et le descripteur moyen des ancres est invariant à la réindexation des ancres tout en préservant l'étendue de la forme. RigidFormer renforce également la rigidité en projetant les mises à jour sur la variété des corps rigides à l'aide d'un alignement de Kabsch différentiable. Sur des benchmarks standard, RigidFormer surpasse ou égale les approches basées sur les maillages en utilisant des entrées sous forme de points, s'exécute plus rapidement, généralise à des résolutions de points non vues et à différents jeux de données, et s'adapte à plus de 200 objets ; nous montrons aussi une extension préliminaire à des corps articulés pilotés par commande en traitant les parties du corps comme des composants interactifs au niveau des objets.
English
Learning-based simulation of multi-object rigid-body dynamics remains difficult because contact is discontinuous and errors compound over long horizons. Most existing methods remain tied to mesh connectivity and vertex-level message passing, which limits their applicability to mesh-free inputs such as point clouds and leads to high computational cost. Efficiently modeling high-fidelity rigid-body dynamics from mesh-free representations, therefore, remains challenging. We introduce RigidFormer, an object-centric Transformer-based model that learns mesh-free rigid-body dynamics with controllable integration step sizes. RigidFormer reasons at the object level and advances each object through compact anchors; Anchor-Vertex Pooling enriches these anchors with local vertex features, retaining contact-relevant geometry without dense vertex-level interaction. We propose Anchor-based RoPE to inject anchor geometry into attention while respecting the unordered nature of objects and anchors: object-token processing is permutation-equivariant, and the mean-pooled anchor descriptor is invariant to anchor reindexing while preserving shape extent. RigidFormer further enforces rigidity by projecting updates onto the rigid-body manifold using differentiable Kabsch alignment. On standard benchmarks, RigidFormer outperforms or matches mesh-based baselines using point inputs, runs faster, generalizes to unseen point resolutions and across datasets, and scales to 200+ objects; we also show a preliminary extension to command-conditioned articulated bodies by treating body parts as interacting object-level components.