PhysisForcing: Natuurkunde-versterkte Wereldsimulator voor Robotmanipulatie
PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation
June 26, 2026
Auteurs: Peiwen Zhang, Yufan Deng, Shangkun Sun, Juncheng Ma, Duomin Wang, Jonas Du, Zilin Pan, Ye Huang, Hao Liang, Songyan Huang, Ruihua Zhang, Enze Xie, Ming-Yu Liu, Daquan Zhou
cs.AI
Samenvatting
Videogeneratiemodellen zijn naar voren gekomen als een veelbelovend paradigma voor belichaamde wereldsimulatie. Zowel algemene videogeneratoren als robotspecifiek met data fijn afgestelde modellen kunnen echter nog steeds fysiek onwaarschijnlijke manipulaties produceren, waaronder discontinue bewegingsbanen en inconsistente robot-objectinteracties, wat hun betrouwbaarheid als wereldsimulatoren beperkt. Uit uitgebreide experimenten blijkt dat dergelijke fysieke instabiliteit voornamelijk voortkomt uit twee factoren: vervorming van bewegende objecten en onwaarschijnlijke spatiotemporele correlaties tussen interagerende entiteiten, met name tijdens contact. Op basis van deze observatie stellen we PhysisForcing voor, een schaalbaar trainingsraamwerk dat fysieke consistentie versterkt door supervisie te richten op fysica-informatieve regio's via gezamenlijke optimalisatie van pixelniveau- en semantisch-niveaukenmerken. Het raamwerk bestaat uit een verlies voor trajectuitlijning op pixelniveau, dat DiT-kenmerken superviseert met behulp van referentiepuntbanen, en een verlies voor relationele uitlijning op semantisch niveau, dat DiT-kenmerken uitlijnt met interregionale relaties geëxtraheerd uit een bevroren video-begripsencoder. Uitgebreide experimenten op R-Bench, PAI-Bench en EZS-Bench tonen aan dat PhysisForcing consistent de belichaamde videogeneratie verbetert ten opzichte van sterke basislijnen, met een verbetering van de Wan2.2-I2V-A14B- en Cosmos3-Nano-basismodellen op R-Bench met 22,3% en 9,2% (7,1% en 3,7% ten opzichte van standaard finetuning), waarbij de Cosmos3-Nano-variant de beste algehele score behaalt. Naast generatie verhoogt het, als wereldmodel onder het WorldArena-actieplannerprotocol, het gesloten-lus-succespercentage van 16,0% naar 24,0% en verbetert het verder het stroomafwaartse beleidssucces, wat aangeeft dat fysiek uitgelijnde videomodellen sterkere representaties opleveren voor robotmanipulatie.
English
Video generation models have emerged as a promising paradigm for embodied world simulation. However, both general-domain video generators and robot-specific data fine-tuned models can still produce physically implausible manipulations, including discontinuous motion trajectories and inconsistent robot-object interactions, which limits their reliability as world simulators. Through extensive experiments, we find that such physical instability mainly arises from two factors: deformation of moving objects and implausible spatio-temporal correlations among interacting entities, particularly during contact. Building on this observation, we propose PhysisForcing, a scalable training framework that strengthens physical consistency by focusing supervision on physics-informative regions through joint optimization of pixel-level and semantic-level features. The framework consists of a pixel-level trajectory alignment loss, which supervises DiT features using reference point trajectories, and a semantic-level relational alignment loss, which aligns DiT features with inter-region relations extracted from a frozen video understanding encoder. Extensive experiments on R-Bench, PAI-Bench, and EZS-Bench show that PhysisForcing consistently improves embodied video generation over strong baselines, improving the Wan2.2-I2V-A14B and Cosmos3-Nano base models on R-Bench by 22.3\% and 9.2\% (7.1\% and 3.7\% over vanilla finetuning), with the Cosmos3-Nano variant attaining the best overall score. Beyond generation, as a world model under the WorldArena action-planner protocol it raises the closed-loop success rate from 16.0\% to 24.0\% and further improves downstream policy success, indicating that physically aligned video models yield stronger representations for robotic manipulation.