ChatPaper.aiChatPaper

Deform360 : un ensemble de données visuotactiles multi-vues massif pour les modèles de monde déformables

Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models

July 6, 2026
Auteurs: Hongyu Li, Wanjia Fu, Xiaoyan Cong, Zekun Li, Binghao Huang, Hanxiao Jiang, Xintong He, Yiqing Liang, Rao Fu, Tao Lu, Srinath Sridhar, Kevin A. Smith, George Konidaris, Yunzhu Li
cs.AI

Résumé

Prédire la dynamique des objets (c'est-à-dire la modélisation du monde) constitue un défi fondamental pour la manipulation robotique, et la modélisation des objets déformables représente un cas particulièrement difficile en raison de leurs espaces d'état de grande dimension et de leurs propriétés matérielles complexes. Les modèles de monde actuels abordent ce problème selon deux paradigmes distincts : l'apprentissage de la dynamique dans l'espace pixel 2D ou dans un espace géométrique 3D plus explicite. Une compréhension systématique de leurs forces et limites relatives reste difficile à établir en raison du manque de données réelles à grande échelle et diversifiées. Pour y remédier, nous présentons Deform360, un jeu de données visuo-tactile à grande échelle comprenant 198 objets de la vie quotidienne, 1 980 séquences d'interaction et plus de 215 heures d'observations provenant de 41 caméras panoramiques et de pinces tactiles bimanuelles, permettant de capturer à la fois le mouvement global et les déformations locales induites par le contact. En exploitant un nouveau pipeline de suivi 3D visuo-tactile sans marqueur pour extraire une géométrie et un mouvement denses, nous évaluons systématiquement les modèles de monde les plus récents, en comparant les modèles vidéo 2D aux modèles particulaires 3D. Enfin, nous fournissons une démonstration préliminaire indiquant l'applicabilité réelle de notre jeu de données en réalisant des tâches de planification robotique sur des objets déformables. Notre analyse révèle des informations clés sur les compromis entre les a priori structurels et l'évolutivité, offrant ainsi une référence solide pour les recherches futures en modélisation généralisable du monde centrée sur les objets déformables. Site web du projet : https://deform360.lhy.xyz
English
Predicting object dynamics (i.e., world modeling) is a fundamental challenge for robotic manipulation, and modeling deformable objects presents a particularly difficult case due to their high-dimensional state spaces and complex material properties. While current world models approach this through two distinct paradigms: learning the dynamics over the 2D pixel space or more explicit 3D geometric space. A systematic understanding of their relative strengths and limitations remains elusive due to the lack of diverse, large-scale real-world data. To address this, we present Deform360, a large-scale visuotactile dataset featuring 198 daily-life objects, 1,980 interaction sequences, and over 215 hours of observations from 41 surround-view cameras and bimanual tactile grippers to capture both global motion and contact-induced local deformations. Leveraging a novel markerless visuotactile 3D tracking pipeline to extract dense geometry and motion, we systematically evaluate current state-of-the-art world models, comparing 2D video models against 3D particle models. Finally, we provide a preliminary demonstration indicating the real-world applicability of our dataset by performing robot planning tasks on deformable objects. Our analysis reveals key insights into the trade-offs between structural priors and scalability, providing a solid benchmark for future research in generalizable deformable object-centric world modeling. Project website: https://deform360.lhy.xyz