ChatPaper.aiChatPaper

Escalado de Preentrenamiento en Video con Mezcla de Expertos para Inteligencia Corpórea

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

July 8, 2026
Autores: Shuailei Ma, Jiaqi Liao, Xinyang Wang, Jingjing Wang, Chaoran Feng, Zijing Hu, Chong Bao, Zichen Xi, Yuqi Gan, Weisen Wang, Yanhong Zeng, Qin Zhao, Zifan Shi, Wei Wu, Hao Ouyang, Qiuyu Wang, Shangzhan Zhang, Jiahao Shao, Yipengjing Sun, Liangxiao Hu, Lunke Pan, Nan Xue, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Ka Leong Cheng
cs.AI

Resumen

A pesar de las recientes promesas en el control robótico, los modelos generativos de video sufren un desajuste de dominio debido a su enfoque principal en la creación de contenido. Por ejemplo, su diseño prioriza inherentemente la fidelidad visual y la creatividad sobre la eficiencia computacional y el realismo físico. En este trabajo, presentamos LingBot-Video, un paradigma de preentrenamiento de video basado en DiT específicamente adaptado para la inteligencia encarnada. Desde la perspectiva arquitectónica, adoptamos el marco de Mezcla de Expertos (MoE), en lugar del denso, para lograr un mejor equilibrio entre la capacidad de modelado y la eficiencia de inferencia, y logramos escalarlo desde cero. Desde la perspectiva de datos, construimos un motor de perfilado de datos que aumenta los videos estándar de internet con amplias secuencias orientadas a robots, que abarcan manipulación, navegación y perspectivas egocéntricas, para dotar al modelo base de una comprensión intrínseca de las acciones y la dinámica del mundo. Desde la perspectiva de entrenamiento, desarrollamos un sistema de recompensa multidimensional para imponer la alineación en cuanto a racionalidad física y finalización de tareas, yendo más allá de criterios estándar como la estética, el seguimiento de instrucciones y la coherencia del movimiento. Evaluaciones exhaustivas validan su rendimiento y eficiencia como modelo fundacional de video. Contribuimos con LingBot-Video como el primer modelo fundacional de video MoE a gran escala y de código abierto para la comunidad, en un esfuerzo pionero por unir la creatividad digital y la actuación física.
English
Despite the recent promise in robot control, video generative models suffer from a domain mismatch due to their primary focus on content creation. For example, their design inherently prioritizes visual fidelity and creativity over computational efficiency and physical realism. In this work, we present LingBot-Video, a DiT-based video pretraining paradigm specifically tailored for embodied intelligence. From the architecture perspective, we adopt the Mixture-of-Experts (MoE), instead of dense, framework to achieve a better trade-off between modeling capacity and inference efficiency, and manage to scale it up from scratch. From the data perspective, we construct a data profiling engine that augments standard internet videos with extensive robot-oriented footage, encompassing manipulation, navigation, and egocentric perspectives, to equip the base model with an intrinsic understanding of actions and world dynamics. From the training perspective, we develop a multi-dimensional reward system to enforce the alignment regarding physical rationality and task completion, going beyond standard criteria such as aesthetics, prompt-following, and motion consistency. Comprehensive evaluations validate its performance and efficiency as a video foundation model. We contribute LingBot-Video as the inaugural large-scale, open-source MoE video foundation model to the community, in a pioneering effort to bridge digital creativity and physical actuation.