Deform360: Un Masivo Conjunto de Datos Visiotáctiles Multivista para Modelos de Mundo Deformables
Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models
July 6, 2026
Autores: Hongyu Li, Wanjia Fu, Xiaoyan Cong, Zekun Li, Binghao Huang, Hanxiao Jiang, Xintong He, Yiqing Liang, Rao Fu, Tao Lu, Srinath Sridhar, Kevin A. Smith, George Konidaris, Yunzhu Li
cs.AI
Resumen
Predecir la dinámica de objetos (es decir, el modelado del mundo) es un desafío fundamental para la manipulación robótica, y modelar objetos deformables resulta particularmente complejo debido a sus espacios de estado de alta dimensión y sus propiedades materiales intrincadas. Los modelos del mundo actuales abordan este problema mediante dos paradigmas distintos: el aprendizaje de la dinámica en el espacio de píxeles 2D o en el espacio geométrico 3D más explícito. Sin embargo, aún no se tiene una comprensión sistemática de sus fortalezas y limitaciones relativas debido a la falta de datos reales diversos y a gran escala. Para abordar esto, presentamos Deform360, un conjunto de datos visiotáctiles a gran escala que incluye 198 objetos cotidianos, 1.980 secuencias de interacción y más de 215 horas de observaciones provenientes de 41 cámaras de visión envolvente y pinzas táctiles bimanuales, con el fin de capturar tanto el movimiento global como las deformaciones locales inducidas por el contacto. Aprovechando un innovador sistema de seguimiento 3D visiotáctil sin marcadores para extraer geometría y movimiento densos, evaluamos sistemáticamente los modelos del mundo de última generación, comparando modelos de video 2D con modelos de partículas 3D. Finalmente, presentamos una demostración preliminar que indica la aplicabilidad en el mundo real de nuestro conjunto de datos, realizando tareas de planificación robótica sobre objetos deformables. Nuestro análisis revela ideas clave sobre las compensaciones entre los priores estructurales y la escalabilidad, proporcionando un punto de referencia sólido para futuras investigaciones en modelado generalizable del mundo centrado en objetos deformables. Sitio web del proyecto: https://deform360.lhy.xyz
English
Predicting object dynamics (i.e., world modeling) is a fundamental challenge for robotic manipulation, and modeling deformable objects presents a particularly difficult case due to their high-dimensional state spaces and complex material properties. While current world models approach this through two distinct paradigms: learning the dynamics over the 2D pixel space or more explicit 3D geometric space. A systematic understanding of their relative strengths and limitations remains elusive due to the lack of diverse, large-scale real-world data. To address this, we present Deform360, a large-scale visuotactile dataset featuring 198 daily-life objects, 1,980 interaction sequences, and over 215 hours of observations from 41 surround-view cameras and bimanual tactile grippers to capture both global motion and contact-induced local deformations. Leveraging a novel markerless visuotactile 3D tracking pipeline to extract dense geometry and motion, we systematically evaluate current state-of-the-art world models, comparing 2D video models against 3D particle models. Finally, we provide a preliminary demonstration indicating the real-world applicability of our dataset by performing robot planning tasks on deformable objects. Our analysis reveals key insights into the trade-offs between structural priors and scalability, providing a solid benchmark for future research in generalizable deformable object-centric world modeling. Project website: https://deform360.lhy.xyz