Deform360: Een grootschalige multi-view visuotactiele dataset voor deformeerbare wereldmodellen
Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models
July 6, 2026
Auteurs: Hongyu Li, Wanjia Fu, Xiaoyan Cong, Zekun Li, Binghao Huang, Hanxiao Jiang, Xintong He, Yiqing Liang, Rao Fu, Tao Lu, Srinath Sridhar, Kevin A. Smith, George Konidaris, Yunzhu Li
cs.AI
Samenvatting
Het voorspellen van objectdynamica (d.w.z. wereldmodellering) is een fundamentele uitdaging voor robotmanipulatie, en het modelleren van vervormbare objecten is een bijzonder moeilijk geval vanwege hun hoogdimensionale toestandsruimten en complexe materiaaleigenschappen. Hoewel huidige wereldmodellen dit benaderen via twee verschillende paradigma's – het leren van de dynamica over de 2D-pixelruimte of de meer expliciete 3D-geometrische ruimte – blijft een systematisch begrip van hun relatieve sterke punten en beperkingen ongrijpbaar door het gebrek aan diverse, grootschalige real-world data. Om dit aan te pakken presenteren we Deform360, een grootschalige visuotactiele dataset met 198 alledaagse objecten, 1.980 interactiesequenties en meer dan 215 uur observaties van 41 rondomzichtcamera's en bimanuele tactiele grijpers, waarmee zowel globale beweging als contactgeïnduceerde lokale vervormingen worden vastgelegd. Door gebruik te maken van een nieuwe markerloze visuotactiele 3D-trackingpijplijn om dichte geometrie en beweging te extraheren, evalueren we systematisch de huidige state-of-the-art wereldmodellen, waarbij we 2D-videomodellen vergelijken met 3D-deeltjesmodellen. Tot slot geven we een voorlopige demonstratie die de real-world toepasbaarheid van onze dataset aantoont door robotplanningstaken op vervormbare objecten uit te voeren. Onze analyse onthult belangrijke inzichten in de afwegingen tussen structurele voorkennis en schaalbaarheid, en biedt een solide benchmark voor toekomstig onderzoek naar generaliseerbare objectgerichte wereldmodellering voor vervormbare objecten. Projectwebsite: https://deform360.lhy.xyz
English
Predicting object dynamics (i.e., world modeling) is a fundamental challenge for robotic manipulation, and modeling deformable objects presents a particularly difficult case due to their high-dimensional state spaces and complex material properties. While current world models approach this through two distinct paradigms: learning the dynamics over the 2D pixel space or more explicit 3D geometric space. A systematic understanding of their relative strengths and limitations remains elusive due to the lack of diverse, large-scale real-world data. To address this, we present Deform360, a large-scale visuotactile dataset featuring 198 daily-life objects, 1,980 interaction sequences, and over 215 hours of observations from 41 surround-view cameras and bimanual tactile grippers to capture both global motion and contact-induced local deformations. Leveraging a novel markerless visuotactile 3D tracking pipeline to extract dense geometry and motion, we systematically evaluate current state-of-the-art world models, comparing 2D video models against 3D particle models. Finally, we provide a preliminary demonstration indicating the real-world applicability of our dataset by performing robot planning tasks on deformable objects. Our analysis reveals key insights into the trade-offs between structural priors and scalability, providing a solid benchmark for future research in generalizable deformable object-centric world modeling. Project website: https://deform360.lhy.xyz