ChatPaper.aiChatPaper

Масштабирование предварительного обучения на видео с использованием смеси экспертов для воплощенного интеллекта

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

July 8, 2026
Авторы: Shuailei Ma, Jiaqi Liao, Xinyang Wang, Jingjing Wang, Chaoran Feng, Zijing Hu, Chong Bao, Zichen Xi, Yuqi Gan, Weisen Wang, Yanhong Zeng, Qin Zhao, Zifan Shi, Wei Wu, Hao Ouyang, Qiuyu Wang, Shangzhan Zhang, Jiahao Shao, Yipengjing Sun, Liangxiao Hu, Lunke Pan, Nan Xue, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Ka Leong Cheng
cs.AI

Аннотация

Несмотря на недавние успехи в управлении роботами, видеогенеративные модели страдают от несоответствия доменов, обусловленного их основной направленностью на создание контента. Например, их архитектура по своей сути ставит визуальную точность и креативность выше вычислительной эффективности и физического реализма. В данной работе мы представляем LingBot-Video — парадигму предобучения видео на основе DiT, специально разработанную для воплощенного интеллекта. С точки зрения архитектуры, мы используем фреймворк Смеси экспертов (MoE) вместо плотного, чтобы достичь лучшего компромисса между моделирующей способностью и эффективностью вывода, и нам удалось масштабировать его с нуля. С точки зрения данных, мы создаем движок профилирования данных, который дополняет стандартные интернет-видео обширными видеоматериалами, ориентированными на роботов и включающими манипуляции, навигацию и эгоцентрические перспективы, чтобы наделить базовую модель внутренним пониманием действий и динамики мира. С точки зрения обучения, мы разрабатываем многомерную систему вознаграждений для обеспечения согласованности в отношении физической рациональности и выполнения задач, выходя за рамки стандартных критериев, таких как эстетика, следование запросу и согласованность движений. Всесторонние оценки подтверждают ее производительность и эффективность в качестве видеофундаментальной модели. Мы предоставляем LingBot-Video сообществу в качестве первой крупномасштабной открытой MoE видеофундаментальной модели, в новаторской попытке соединить цифровое творчество и физическое управление.
English
Despite the recent promise in robot control, video generative models suffer from a domain mismatch due to their primary focus on content creation. For example, their design inherently prioritizes visual fidelity and creativity over computational efficiency and physical realism. In this work, we present LingBot-Video, a DiT-based video pretraining paradigm specifically tailored for embodied intelligence. From the architecture perspective, we adopt the Mixture-of-Experts (MoE), instead of dense, framework to achieve a better trade-off between modeling capacity and inference efficiency, and manage to scale it up from scratch. From the data perspective, we construct a data profiling engine that augments standard internet videos with extensive robot-oriented footage, encompassing manipulation, navigation, and egocentric perspectives, to equip the base model with an intrinsic understanding of actions and world dynamics. From the training perspective, we develop a multi-dimensional reward system to enforce the alignment regarding physical rationality and task completion, going beyond standard criteria such as aesthetics, prompt-following, and motion consistency. Comprehensive evaluations validate its performance and efficiency as a video foundation model. We contribute LingBot-Video as the inaugural large-scale, open-source MoE video foundation model to the community, in a pioneering effort to bridge digital creativity and physical actuation.