ChatPaper.aiChatPaper

RigidFormer: Leren van starre dynamica met Transformers

RigidFormer: Learning Rigid Dynamics using Transformers

May 9, 2026
Auteurs: Zhiyang Dou, Minghao Guo, Haixu Wu, Doug Roble, Tuur Stuyck, Wojciech Matusik
cs.AI

Samenvatting

Op leren gebaseerde simulatie van multi-object starre-lichaamsdynamica blijft moeilijk omdat contact discontinu is en fouten cumuleren over lange tijdshorizonten. De meeste bestaande methoden blijven gebonden aan mesh-connectiviteit en berichtuitwisseling op vertex-niveau, wat hun toepasbaarheid op mesh-vrije invoer zoals puntwolken beperkt en leidt tot hoge rekenkosten. Het efficiënt modelleren van hifi starre-lichaamsdynamica vanuit mesh-vrije representaties blijft daarom uitdagend. Wij introduceren RigidFormer, een object-centrisch op Transformer gebaseerd model dat mesh-vrije starre-lichaamsdynamica leert met controleerbare integratiestapgroottes. RigidFormer redeneert op objectniveau en beweegt elk object voort via compacte ankers; Anchor-Vertex Pooling verrijkt deze ankers met lokale vertexkenmerken, waarbij contactrelevante geometrie behouden blijft zonder dichte interactie op vertex-niveau. Wij stellen op ankers gebaseerde RoPE voor om ankergeometrie in de aandacht te injecteren met respect voor de ongeordende aard van objecten en ankers: object-tokenverwerking is permutatie-equivariant, en de gemiddeld gepoolde ankerdescriptor is invariant voor herindexering van ankers terwijl de vormomvang behouden blijft. RigidFormer handhaaft verder starheid door updates te projecteren op de starre-lichaamsvariëteit met behulp van differentieerbare Kabsch-uitlijning. Op standaard benchmarks presteert RigidFormer beter dan of gelijk aan mesh-gebaseerde baselines met punteninvoer, draait sneller, generaliseert naar ongeziene puntresoluties en over datasets heen, en schaalt naar 200+ objecten; wij tonen ook een voorlopige uitbreiding naar commando-gestuurde gelede lichamen door lichaamsdelen te behandelen als interacterende componenten op objectniveau.
English
Learning-based simulation of multi-object rigid-body dynamics remains difficult because contact is discontinuous and errors compound over long horizons. Most existing methods remain tied to mesh connectivity and vertex-level message passing, which limits their applicability to mesh-free inputs such as point clouds and leads to high computational cost. Efficiently modeling high-fidelity rigid-body dynamics from mesh-free representations, therefore, remains challenging. We introduce RigidFormer, an object-centric Transformer-based model that learns mesh-free rigid-body dynamics with controllable integration step sizes. RigidFormer reasons at the object level and advances each object through compact anchors; Anchor-Vertex Pooling enriches these anchors with local vertex features, retaining contact-relevant geometry without dense vertex-level interaction. We propose Anchor-based RoPE to inject anchor geometry into attention while respecting the unordered nature of objects and anchors: object-token processing is permutation-equivariant, and the mean-pooled anchor descriptor is invariant to anchor reindexing while preserving shape extent. RigidFormer further enforces rigidity by projecting updates onto the rigid-body manifold using differentiable Kabsch alignment. On standard benchmarks, RigidFormer outperforms or matches mesh-based baselines using point inputs, runs faster, generalizes to unseen point resolutions and across datasets, and scales to 200+ objects; we also show a preliminary extension to command-conditioned articulated bodies by treating body parts as interacting object-level components.