ChatPaper.aiChatPaper

Deform360: Масштабный многовидовой визуально-тактильный набор данных для моделей деформируемого мира

Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models

July 6, 2026
Авторы: Hongyu Li, Wanjia Fu, Xiaoyan Cong, Zekun Li, Binghao Huang, Hanxiao Jiang, Xintong He, Yiqing Liang, Rao Fu, Tao Lu, Srinath Sridhar, Kevin A. Smith, George Konidaris, Yunzhu Li
cs.AI

Аннотация

Прогнозирование динамики объектов (т.е. моделирование мира) является фундаментальной задачей роботизированного манипулирования, причем моделирование деформируемых объектов представляет собой особенно сложный случай из-за их многомерных пространств состояний и сложных материальных свойств. В настоящее время мировые модели подходят к этому через две различные парадигмы: обучение динамике в 2D пространстве пикселей или в более явном 3D геометрическом пространстве. Систематическое понимание их относительных сильных сторон и ограничений остается неясным из-за отсутствия разнообразных крупномасштабных реальных данных. Чтобы решить эту проблему, мы представляем Deform360 — крупномасштабный визуально-тактильный набор данных, включающий 198 предметов повседневного обихода, 1980 последовательностей взаимодействий и более 215 часов наблюдений с 41 камеры кругового обзора и двуручных тактильных захватов для регистрации как глобального движения, так и локальных деформаций, вызванных контактом. Используя новый безмаркерный визуально-тактильный 3D конвейер отслеживания для извлечения плотной геометрии и движения, мы систематически оцениваем современные мировые модели, сравнивая 2D видеомодели с 3D моделями частиц. Наконец, мы приводим предварительную демонстрацию, показывающую практическую применимость нашего набора данных, выполняя задачи планирования роботов на деформируемых объектах. Наш анализ выявляет ключевые представления о компромиссах между структурными априорными знаниями и масштабируемостью, обеспечивая надежный ориентир для будущих исследований в области обобщаемого моделирования мира, ориентированного на деформируемые объекты. Веб-сайт проекта: https://deform360.lhy.xyz
English
Predicting object dynamics (i.e., world modeling) is a fundamental challenge for robotic manipulation, and modeling deformable objects presents a particularly difficult case due to their high-dimensional state spaces and complex material properties. While current world models approach this through two distinct paradigms: learning the dynamics over the 2D pixel space or more explicit 3D geometric space. A systematic understanding of their relative strengths and limitations remains elusive due to the lack of diverse, large-scale real-world data. To address this, we present Deform360, a large-scale visuotactile dataset featuring 198 daily-life objects, 1,980 interaction sequences, and over 215 hours of observations from 41 surround-view cameras and bimanual tactile grippers to capture both global motion and contact-induced local deformations. Leveraging a novel markerless visuotactile 3D tracking pipeline to extract dense geometry and motion, we systematically evaluate current state-of-the-art world models, comparing 2D video models against 3D particle models. Finally, we provide a preliminary demonstration indicating the real-world applicability of our dataset by performing robot planning tasks on deformable objects. Our analysis reveals key insights into the trade-offs between structural priors and scalability, providing a solid benchmark for future research in generalizable deformable object-centric world modeling. Project website: https://deform360.lhy.xyz