ChatPaper.aiChatPaper

Escalonamento do Pré-treinamento em Vídeo com Mistura de Especialistas para Inteligência Incorporada

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

July 8, 2026
Autores: Shuailei Ma, Jiaqi Liao, Xinyang Wang, Jingjing Wang, Chaoran Feng, Zijing Hu, Chong Bao, Zichen Xi, Yuqi Gan, Weisen Wang, Yanhong Zeng, Qin Zhao, Zifan Shi, Wei Wu, Hao Ouyang, Qiuyu Wang, Shangzhan Zhang, Jiahao Shao, Yipengjing Sun, Liangxiao Hu, Lunke Pan, Nan Xue, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Ka Leong Cheng
cs.AI

Resumo

Apesar do recente avanço no controle de robôs, os modelos generativos de vídeo sofrem de uma incompatibilidade de domínio devido ao seu foco principal na criação de conteúdo. Por exemplo, seu projeto prioriza inerentemente a fidelidade visual e a criatividade em detrimento da eficiência computacional e do realismo físico. Neste trabalho, apresentamos o LingBot-Video, um paradigma de pré-treinamento de vídeo baseado em DiT, especificamente adaptado para inteligência incorporada. Do ponto de vista arquitetural, adotamos a estrutura de Mixagem de Especialistas (MoE), em vez de densa, para alcançar um melhor equilíbrio entre capacidade de modelagem e eficiência de inferência, conseguindo escaloná-la do zero. Do ponto de vista dos dados, construímos um mecanismo de perfilamento de dados que aumenta vídeos padrão da internet com extensas filmagens orientadas a robôs, abrangendo manipulação, navegação e perspectivas egocêntricas, para dotar o modelo base de uma compreensão intrínseca de ações e dinâmicas do mundo. Do ponto de vista do treinamento, desenvolvemos um sistema de recompensa multidimensional para impor o alinhamento em relação à racionalidade física e à conclusão de tarefas, indo além de critérios padrão, como estética, adesão ao prompt e consistência de movimento. Avaliações abrangentes validam seu desempenho e eficiência como modelo de fundação de vídeo. Contribuímos com o LingBot-Video como o primeiro modelo de fundação de vídeo MoE de grande escala e código aberto para a comunidade, em um esforço pioneiro para unir criatividade digital e atuação física.
English
Despite the recent promise in robot control, video generative models suffer from a domain mismatch due to their primary focus on content creation. For example, their design inherently prioritizes visual fidelity and creativity over computational efficiency and physical realism. In this work, we present LingBot-Video, a DiT-based video pretraining paradigm specifically tailored for embodied intelligence. From the architecture perspective, we adopt the Mixture-of-Experts (MoE), instead of dense, framework to achieve a better trade-off between modeling capacity and inference efficiency, and manage to scale it up from scratch. From the data perspective, we construct a data profiling engine that augments standard internet videos with extensive robot-oriented footage, encompassing manipulation, navigation, and egocentric perspectives, to equip the base model with an intrinsic understanding of actions and world dynamics. From the training perspective, we develop a multi-dimensional reward system to enforce the alignment regarding physical rationality and task completion, going beyond standard criteria such as aesthetics, prompt-following, and motion consistency. Comprehensive evaluations validate its performance and efficiency as a video foundation model. We contribute LingBot-Video as the inaugural large-scale, open-source MoE video foundation model to the community, in a pioneering effort to bridge digital creativity and physical actuation.