ChatPaper.aiChatPaper

PhysisForcing: Simulador de Mundo Reforçado por Física para Manipulação Robótica

PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation

June 26, 2026
Autores: Peiwen Zhang, Yufan Deng, Shangkun Sun, Juncheng Ma, Duomin Wang, Jonas Du, Zilin Pan, Ye Huang, Hao Liang, Songyan Huang, Ruihua Zhang, Enze Xie, Ming-Yu Liu, Daquan Zhou
cs.AI

Resumo

Os modelos de geração de vídeo emergiram como um paradigma promissor para a simulação de mundo incorporado. No entanto, tanto geradores de vídeo de domínio geral quanto modelos ajustados com dados específicos de robôs ainda podem produzir manipulações fisicamente implausíveis, incluindo trajetórias de movimento descontínuas e interações inconsistentes entre robô e objetos, o que limita sua confiabilidade como simuladores de mundo. Por meio de experimentos extensivos, descobrimos que essa instabilidade física decorre principalmente de dois fatores: deformação de objetos em movimento e correlações espaço-temporais implausíveis entre entidades em interação, particularmente durante o contato. Com base nessa observação, propomos o PhysisForcing, uma estrutura de treinamento escalável que fortalece a consistência física ao concentrar a supervisão em regiões informativas para a física, por meio da otimização conjunta de características em nível de pixel e semântico. A estrutura consiste em uma perda de alinhamento de trajetória em nível de pixel, que supervisiona as características DiT usando trajetórias de pontos de referência, e uma perda de alinhamento relacional em nível semântico, que alinha as características DiT com relações entre regiões extraídas de um codificador de compreensão de vídeo congelado. Experimentos extensivos em R-Bench, PAI-Bench e EZS-Bench mostram que o PhysisForcing melhora consistentemente a geração de vídeo incorporado em relação a linhas de base fortes, aprimorando os modelos de base Wan2.2-I2V-A14B e Cosmos3-Nano no R-Bench em 22,3% e 9,2% (7,1% e 3,7% sobre o ajuste fino padrão), com a variante Cosmos3-Nano alcançando a melhor pontuação geral. Além da geração, como modelo de mundo sob o protocolo planejador de ações WorldArena, ele eleva a taxa de sucesso em malha fechada de 16,0% para 24,0% e melhora ainda mais o sucesso da política downstream, indicando que modelos de vídeo alinhados fisicamente produzem representações mais fortes para manipulação robótica.
English
Video generation models have emerged as a promising paradigm for embodied world simulation. However, both general-domain video generators and robot-specific data fine-tuned models can still produce physically implausible manipulations, including discontinuous motion trajectories and inconsistent robot-object interactions, which limits their reliability as world simulators. Through extensive experiments, we find that such physical instability mainly arises from two factors: deformation of moving objects and implausible spatio-temporal correlations among interacting entities, particularly during contact. Building on this observation, we propose PhysisForcing, a scalable training framework that strengthens physical consistency by focusing supervision on physics-informative regions through joint optimization of pixel-level and semantic-level features. The framework consists of a pixel-level trajectory alignment loss, which supervises DiT features using reference point trajectories, and a semantic-level relational alignment loss, which aligns DiT features with inter-region relations extracted from a frozen video understanding encoder. Extensive experiments on R-Bench, PAI-Bench, and EZS-Bench show that PhysisForcing consistently improves embodied video generation over strong baselines, improving the Wan2.2-I2V-A14B and Cosmos3-Nano base models on R-Bench by 22.3\% and 9.2\% (7.1\% and 3.7\% over vanilla finetuning), with the Cosmos3-Nano variant attaining the best overall score. Beyond generation, as a world model under the WorldArena action-planner protocol it raises the closed-loop success rate from 16.0\% to 24.0\% and further improves downstream policy success, indicating that physically aligned video models yield stronger representations for robotic manipulation.