ChatPaper.aiChatPaper

Play2Perfect: Wat telt bij behendige spelpretraining voor nauwkeurige assemblage?

Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?

June 24, 2026
Auteurs: Tyler Ga Wei Lum, Kushal Kedia, C. Karen Liu, Jeannette Bohg
cs.AI

Samenvatting

Meervingerige robots beloven de snelheid en behendigheid van menselijke handen, maar uitdagende problemen zoals precisiemontage blijven buiten bereik. Deze taken zijn contactrijk, waardoor gegevensverzameling voor imitatieleren moeilijk is, en hebben een schaarse beloning, waardoor directe exploratie met reinforcement learning (RL) onhaalbaar is. Daarom heeft eerder werk vooruitgang geboekt door het probleem te structureren met gespecialiseerde grijpers, gereedschapsbevestigingen en omgevingsbevestigingen. In dit werk stellen we dat een robot, voordat hij precisiemontage kan perfectioneren, eerst moet leren spelen. We stellen verder de vraag: welke factoren in het leerproces van spelen zijn van belang voor precisiemontage? We stellen Play2Perfect voor, een RL-framework voor taakonafhankelijke voortraining door middel van spel met diverse objecten en doelen, dat vervolgens wordt geperfectioneerd voor precisiemontage. Het doel van spel is het verwerven van herbruikbare manipulatiepriors, zoals grijpen, heroriënteren in de hand en het bereiken van een pose. Verfijning past deze algemene prior vervolgens aan voor montage, waarbij de exploratie wordt gericht op de laatste contactrijke, zeer nauwkeurige interacties die nodig zijn voor succes. We bestuderen systematisch de belangrijkste ontwerpkeuzes in spelvoortraining, waaronder objectdiversiteit, trainingsdoel, trajectdiversiteit en doelnauwkeurigheid. We laten zien dat onze prior 33x monster-efficiënter is dan RL-training vanaf nul, zelfs wanneer voorzien van dichte, meerfasige beloningen. We demonstreren zero-shot sim-naar-real overdracht, met 60% succes bij nauwe inserties met slechts 0,5 mm contactspeling, en meer dan 50% succes bij lange-horizon montage van meerdere onderdelen en schroeven.
English
Multi-fingered robots promise the speed and dexterity of human hands, yet challenging problems such as precise assembly have remained out of reach. These tasks are contact-rich, making data collection for imitation learning difficult, and sparse-reward, making direct exploration with reinforcement learning (RL) intractable. Consequently, prior work has made progress by structuring the problem with specialized grippers, tool attachments, and environment fixtures. In this work, we argue that before a robot can perfect precise assembly, it must first learn to play. We further ask the question: what factors in the process of learning to play matter for precise assembly? We propose Play2Perfect, an RL framework for task-agnostic pretraining through play on diverse objects and goals, which is then perfected on precise assembly. The goal of play is to acquire reusable manipulation priors, such as grasping, in-hand reorientation and pose reaching. Finetuning then adapts this general prior to assembly, focusing exploration on the final contact-rich, high-precision interactions needed for success. We systematically study key design choices in play pretraining, including object diversity, training objective, trajectory diversity, and goal precision. We show that our prior is 33x more sample-efficient than RL training from scratch, even when provided with dense, multi-stage rewards. We demonstrate zero-shot sim-to-real transfer, achieving 60% success on tight insertions with only 0.5 mm contact clearance, and over 50% success on long-horizon multi-part assembly and screwing.