ChatPaper.aiChatPaper

Passage à l'échelle du pré-entraînement vidéo par mélange d'experts pour l'intelligence incarnée

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

July 8, 2026
Auteurs: Shuailei Ma, Jiaqi Liao, Xinyang Wang, Jingjing Wang, Chaoran Feng, Zijing Hu, Chong Bao, Zichen Xi, Yuqi Gan, Weisen Wang, Yanhong Zeng, Qin Zhao, Zifan Shi, Wei Wu, Hao Ouyang, Qiuyu Wang, Shangzhan Zhang, Jiahao Shao, Yipengjing Sun, Liangxiao Hu, Lunke Pan, Nan Xue, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Ka Leong Cheng
cs.AI

Résumé

Malgré les récentes avancées prometteuses dans le contrôle robotique, les modèles génératifs vidéo souffrent d'un décalage de domaine dû à leur focalisation principale sur la création de contenu. Par exemple, leur conception privilégie intrinsèquement la fidélité visuelle et la créativité au détriment de l'efficacité computationnelle et du réalisme physique. Dans ce travail, nous présentons LingBot-Video, un paradigme de pré-entraînement vidéo basé sur DiT, spécifiquement adapté à l'intelligence incarnée. Du point de vue architectural, nous adoptons une structure de MoE (Mixtes d'Experts), plutôt que dense, afin d'obtenir un meilleur compromis entre capacité de modélisation et efficacité d'inférence, et parvenons à la mettre à l'échelle à partir de zéro. Du point de vue des données, nous construisons un moteur de profilage de données qui enrichit les vidéos internet standard avec un vaste ensemble de séquences orientées robotique, incluant la manipulation, la navigation et les perspectives égocentriques, afin de doter le modèle de base d'une compréhension intrinsèque des actions et de la dynamique du monde. Du point de vue de l'entraînement, nous développons un système de récompenses multidimensionnel pour imposer un alignement concernant la rationalité physique et l'accomplissement des tâches, allant au-delà des critères standards tels que l'esthétique, le respect des consignes et la cohérence du mouvement. Des évaluations exhaustives valident ses performances et son efficacité en tant que modèle de base vidéo. Nous contribuons avec LingBot-Video comme premier modèle de base vidéo MoE open-source à grande échelle de la communauté, dans un effort pionnier visant à relier la créativité numérique et l'action physique.
English
Despite the recent promise in robot control, video generative models suffer from a domain mismatch due to their primary focus on content creation. For example, their design inherently prioritizes visual fidelity and creativity over computational efficiency and physical realism. In this work, we present LingBot-Video, a DiT-based video pretraining paradigm specifically tailored for embodied intelligence. From the architecture perspective, we adopt the Mixture-of-Experts (MoE), instead of dense, framework to achieve a better trade-off between modeling capacity and inference efficiency, and manage to scale it up from scratch. From the data perspective, we construct a data profiling engine that augments standard internet videos with extensive robot-oriented footage, encompassing manipulation, navigation, and egocentric perspectives, to equip the base model with an intrinsic understanding of actions and world dynamics. From the training perspective, we develop a multi-dimensional reward system to enforce the alignment regarding physical rationality and task completion, going beyond standard criteria such as aesthetics, prompt-following, and motion consistency. Comprehensive evaluations validate its performance and efficiency as a video foundation model. We contribute LingBot-Video as the inaugural large-scale, open-source MoE video foundation model to the community, in a pioneering effort to bridge digital creativity and physical actuation.