Play2Perfect: O Que Importa no Pré-Treinamento de Jogo Hábil para Montagem Precisa?
Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?
June 24, 2026
Autores: Tyler Ga Wei Lum, Kushal Kedia, C. Karen Liu, Jeannette Bohg
cs.AI
Resumo
Robôs multifingados prometem a velocidade e destreza das mãos humanas, porém problemas desafiadores, como montagem de precisão, ainda permanecem inatingíveis. Essas tarefas são ricas em contato, dificultando a coleta de dados para aprendizagem por imitação, e possuem recompensas esparsas, tornando a exploração direta com aprendizado por reforço (AR) intratável. Consequentemente, trabalhos anteriores avançaram ao estruturar o problema com garras especializadas, acessórios de ferramentas e fixações ambientais. Neste trabalho, argumentamos que, antes de um robô aperfeiçoar a montagem de precisão, ele deve primeiro aprender a brincar. Ainda perguntamos: quais fatores no processo de aprender a brincar são importantes para a montagem de precisão? Propomos Play2Perfect, uma estrutura de AR para pré-treinamento agnóstico à tarefa por meio de brincadeiras com diversos objetos e objetivos, que é então aperfeiçoado para montagem de precisão. O objetivo da brincadeira é adquirir prévias de manipulação reutilizáveis, como agarrar, reorientação na mão e alcance de pose. O ajuste fino adapta então essa prévia geral à montagem, concentrando a exploração nas interações finais ricas em contato e de alta precisão necessárias para o sucesso. Estudamos sistematicamente escolhas-chave de projeto no pré-treinamento com brincadeiras, incluindo diversidade de objetos, objetivo de treinamento, diversidade de trajetórias e precisão de objetivo. Mostramos que nossa prévia é 33 vezes mais eficiente em amostras do que o treinamento de AR do zero, mesmo quando fornecido com recompensas densas e de múltiplos estágios. Demonstramos transferência sim-para-real zero-shot, alcançando 60% de sucesso em inserções apertadas com apenas 0,5 mm de folga de contato, e mais de 50% de sucesso em montagem de múltiplas peças de longo horizonte e aparafusamento.
English
Multi-fingered robots promise the speed and dexterity of human hands, yet challenging problems such as precise assembly have remained out of reach. These tasks are contact-rich, making data collection for imitation learning difficult, and sparse-reward, making direct exploration with reinforcement learning (RL) intractable. Consequently, prior work has made progress by structuring the problem with specialized grippers, tool attachments, and environment fixtures. In this work, we argue that before a robot can perfect precise assembly, it must first learn to play. We further ask the question: what factors in the process of learning to play matter for precise assembly? We propose Play2Perfect, an RL framework for task-agnostic pretraining through play on diverse objects and goals, which is then perfected on precise assembly. The goal of play is to acquire reusable manipulation priors, such as grasping, in-hand reorientation and pose reaching. Finetuning then adapts this general prior to assembly, focusing exploration on the final contact-rich, high-precision interactions needed for success. We systematically study key design choices in play pretraining, including object diversity, training objective, trajectory diversity, and goal precision. We show that our prior is 33x more sample-efficient than RL training from scratch, even when provided with dense, multi-stage rewards. We demonstrate zero-shot sim-to-real transfer, achieving 60% success on tight insertions with only 0.5 mm contact clearance, and over 50% success on long-horizon multi-part assembly and screwing.