ChatPaper.aiChatPaper

GRAIL : Génération de loco-manipulation humanoïde à partir d'actifs 3D et de priors vidéo.

GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors

June 3, 2026
Auteurs: Tianyi Xie, Haotian Zhang, Jinhyung Park, Zi Wang, Bowen Wen, Jiefeng Li, Xueting Li, Qingwei Ben, Haoyang Weng, Yufei Ye, David Minor, Tingwu Wang, Chenfanfu Jiang, Sanja Fidler, Jan Kautz, Linxi Fan, Yuke Zhu, Zhengyi Luo, Umar Iqbal, Ye Yuan
cs.AI

Résumé

La mise à l'échelle de la loco-manipulation humanoïde nécessite des démonstrations compatibles avec le robot, couvrant divers objets, mouvements du corps entier et géométries de scène, mais la téléopération et la capture de mouvement sont difficiles à généraliser car chaque collecte dépend de configurations physiques, d'acteurs instrumentés et de l'exploitation du robot. Nous présentons GRAIL, un pipeline de génération numérique qui reste entièrement virtuel jusqu'au déploiement : il compose des actifs 3D, des scènes prêtes pour la simulation et des connaissances a priori issues de modèles fondamentaux vidéo (VFM) afin de synthétiser des interactions sans reconstruire d'environnements physiques ni téléopérer le robot. Plutôt que de reconstruire des vidéos sauvages non contraintes, GRAIL part de configurations 3D entièrement spécifiées dans lesquelles la géométrie des objets, les paramètres de caméra, l'échelle métrique, la profondeur de l'environnement et un personnage proportionné au robot sont connus avant la génération vidéo et réutilisés lors de la reconstruction. Cette configuration privilégiée conditionne mieux la reconstruction 4D, permettant un suivi d'objets basé sur modèle, une estimation du mouvement humain et une optimisation tenant compte de l'interaction pour reconstruire des trajectoires métriques 4D d'interaction homme-objet (HOI) avec une ambiguïté de profondeur et un décalage morphologique réduits. Nous réaffectons les mouvements reconstruits à un robot humanoïde et entraînons des trackers complémentaires généralistes : un adaptateur latent sensible aux objets pour la manipulation et un tracker sensible à la scène pour le franchissement de terrain. GRAIL produit plus de 20 000 séquences couvrant la saisie, la manipulation d'objets, l'assise et le franchissement de terrain. En n'utilisant que des données générées par GRAIL, nous entraînons des politiques visuelles égocentriques via un pipeline sim-vers-réel et les déployons sur un humanoïde Unitree G1, atteignant 84 % de succès en conditions réelles pour la saisie d'objets variés et 90 % de succès pour la montée d'escaliers.
English
Scaling humanoid loco-manipulation requires robot-compatible demonstrations across diverse objects, whole-body motions, and scene geometries, but teleoperation and motion capture are difficult to scale because each collection depends on physical setups, instrumented actors, and robot operation. We present GRAIL, a digital generation pipeline that remains fully virtual until deployment: it composes 3D assets, simulator-ready scenes, and priors from video foundation models (VFMs) to synthesize interactions without rebuilding physical environments or teleoperating the robot. Rather than reconstructing unconstrained in-the-wild videos, GRAIL starts from fully specified 3D configurations in which object geometry, camera parameters, metric scale, environment depth, and a robot-proportioned character are known before video generation and reused during reconstruction. This privileged setup better conditions 4D recovery, allowing model-based object tracking, human motion estimation, and interaction-aware optimization to reconstruct metric 4D human-object interaction (HOI) trajectories with reduced depth ambiguity and morphology mismatch. We retarget the recovered motions to a humanoid robot and train complementary task-general trackers: an object-aware latent adaptor for manipulation and a scene-aware tracker for terrain traversal. GRAIL produces over 20,000 sequences spanning pick-up, object manipulation, sitting, and terrain traversal. Using only GRAIL-generated data, we train egocentric visual policies through a sim-to-real pipeline and deploy them on a Unitree G1 humanoid, achieving 84\% real-world success on diverse object pick-up and 90\% success on stair-climbing.