ChatPaper.aiChatPaper

PhysiFormer: Aprendendo a Simular Mecânica no Espaço Mundial

PhysiFormer: Learning to Simulate Mechanics in World Space

June 25, 2026
Autores: Yiming Chen, Yushi Lan, Andrea Vedaldi
cs.AI

Resumo

Apresentamos o PhysiFormer, um transformador de difusão para movimento tridimensional de objetos fisicamente plausível. Diferentemente de modelos de mundo em vídeo que operam no espaço de pixels dependente da vista, o PhysiFormer representa objetos como malhas 3D expressas em coordenadas do mundo. Dadas as posições e velocidades iniciais dos vértices, bem como o tipo de material do objeto, rígido ou elástico, o modelo amostra trajetórias futuras dos vértices. Enquanto abordagens relacionadas de física neural baseiam-se em espaços latentes ad-hoc ou impõem explicitamente rigidez e causalidade, o PhysiFormer demonstra que resultados excelentes podem ser obtidos sem tais vieses indutivos, tratando a predição de trajetórias de vértices como um único processo de difusão de desruído diretamente em coordenadas do mundo. A formulação probabilística captura a incerteza na dinâmica aprendida, permitindo futuros diversos e plausíveis a partir de condições iniciais, tornando esta estrutura potencialmente útil para aplicações com incerteza não observada. O modelo apresenta atenção fatorada em tempo, espaço e objetos para eficiência, possibilitando raciocínio multi-objeto invariante a permutações sem necessidade de codificação explícita de objetos. Treinado em mais de 100 mil trajetórias simuladas, o PhysiFormer gera mecânica rígida e elástica, e generaliza para cenários de materiais mistos, geometrias do mundo real não vistas anteriormente e contagens maiores de objetos. Ele supera substancialmente as linhas de base autorregressivas em precisão de trajetória, preservação de rigidez e consistência física baseada em momento. Nossos resultados posicionam a difusão no espaço de coordenadas como um passo promissor rumo à modelagem de mundo invariante à vista e consciente da geometria para robótica, computação gráfica e design físico. Visualizações, código e modelos estão disponíveis em https://yimingc9.github.io/physiformer.
English
We present PhysiFormer, a diffusion transformer for physically-plausible 3D object motion. Unlike video world models that operate in view-dependent pixel space, PhysiFormer represents objects as 3D meshes expressed in world coordinates. Given the initial vertex positions and velocities, as well as object material type, rigid or elastic, the model samples future vertex trajectories. While related neural physics approaches build on ad-hoc latent spaces or explicitly enforce rigidity and causality, PhysiFormer shows that excellent results can be obtained without any such inductive biases, by casting vertex trajectory prediction as a single denoising diffusion process directly in world coordinates. The probabilistic formulation captures uncertainty in the learned dynamics, enabling diverse plausible futures from initial conditions, making this framework potentially useful for applications with unobserved uncertainty. The model features attention factorised over time, space, and objects for efficiency, enabling permutation-invariant multi-object reasoning without needing explicit object encoding. Trained on over 100k simulated trajectories, PhysiFormer generates rigid and elastic mechanics, and generalises to mixed-material settings, unseen real-world geometries, and larger object counts. It substantially outperforms autoregressive baselines in trajectory accuracy, rigidity preservation, and momentum-based physical consistency. Our results position coordinate-space diffusion as a promising step toward view-invariant, geometry-aware world modelling for robotics, graphics, and physical design. Visualisations, code, and models are available at https://yimingc9.github.io/physiformer.