Deform360: Um Conjunto de Dados Visuotáteis Maciço com Múltiplas Vistas para Modelos de Mundo Deformáveis
Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models
July 6, 2026
Autores: Hongyu Li, Wanjia Fu, Xiaoyan Cong, Zekun Li, Binghao Huang, Hanxiao Jiang, Xintong He, Yiqing Liang, Rao Fu, Tao Lu, Srinath Sridhar, Kevin A. Smith, George Konidaris, Yunzhu Li
cs.AI
Resumo
Prever a dinâmica de objetos (ou seja, modelagem do mundo) é um desafio fundamental para a manipulação robótica, e a modelagem de objetos deformáveis apresenta um caso particularmente difícil devido aos seus espaços de estado de alta dimensionalidade e propriedades materiais complexas. Embora os modelos de mundo atuais abordem isso por meio de dois paradigmas distintos: aprender a dinâmica no espaço de pixels 2D ou no espaço geométrico 3D mais explícito, uma compreensão sistemática de seus pontos fortes e limitações relativos permanece elusiva devido à falta de dados reais diversos e em grande escala. Para abordar isso, apresentamos o Deform360, um conjunto de dados visuotáteis em larga escala que apresenta 198 objetos do cotidiano, 1.980 sequências de interação e mais de 215 horas de observações de 41 câmeras de visão panorâmica e garras táteis bimanuais para capturar tanto o movimento global quanto as deformações locais induzidas por contato. Utilizando um novo pipeline inovador de rastreamento 3D visuotátil sem marcadores para extrair geometria e movimento densos, avaliamos sistematicamente os modelos de mundo atuais do estado da arte, comparando modelos de vídeo 2D com modelos de partículas 3D. Finalmente, fornecemos uma demonstração preliminar indicando a aplicabilidade real do nosso conjunto de dados ao realizar tarefas de planejamento robótico em objetos deformáveis. Nossa análise revela insights importantes sobre as compensações entre prioridades estruturais e escalabilidade, fornecendo um benchmark sólido para pesquisas futuras em modelagem de mundo centrada em objetos deformáveis generalizáveis. Site do projeto: https://deform360.lhy.xyz
English
Predicting object dynamics (i.e., world modeling) is a fundamental challenge for robotic manipulation, and modeling deformable objects presents a particularly difficult case due to their high-dimensional state spaces and complex material properties. While current world models approach this through two distinct paradigms: learning the dynamics over the 2D pixel space or more explicit 3D geometric space. A systematic understanding of their relative strengths and limitations remains elusive due to the lack of diverse, large-scale real-world data. To address this, we present Deform360, a large-scale visuotactile dataset featuring 198 daily-life objects, 1,980 interaction sequences, and over 215 hours of observations from 41 surround-view cameras and bimanual tactile grippers to capture both global motion and contact-induced local deformations. Leveraging a novel markerless visuotactile 3D tracking pipeline to extract dense geometry and motion, we systematically evaluate current state-of-the-art world models, comparing 2D video models against 3D particle models. Finally, we provide a preliminary demonstration indicating the real-world applicability of our dataset by performing robot planning tasks on deformable objects. Our analysis reveals key insights into the trade-offs between structural priors and scalability, providing a solid benchmark for future research in generalizable deformable object-centric world modeling. Project website: https://deform360.lhy.xyz