VideoChat3: Полностью открытая видео MLLM для эффективного и универсального понимания видео

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

July 16, 2026
Авторы: Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang
cs.AI

Аннотация

Недавние достижения в области понимания видео охватывают движение, длинные видео и потоковое взаимодействие, приближая эту область к реальным приложениям. Несмотря на этот прогресс, современные открытые модели по-прежнему имеют ряд ограничений. Они часто плохо обобщают различные типы видео, что делает их эффективными только в конкретных доменах. Высокие вычислительные требования дополнительно ограничивают их эффективность и масштабируемость. Более того, большинство моделей являются лишь частично открытыми: ключевые компоненты, такие как код обучения, стратегия или наборы данных, недоступны, что затрудняет воспроизводимость и замедляет развитие сообщества. Для решения этих проблем мы представляем VideoChat3 — полностью открытую, эффективную и универсальную видеориентированную мультимодальную большую языковую модель (MLLM). VideoChat3 продвигает понимание видео с помощью двух взаимодополняющих подходов. Для эффективности мы внедряем Расширенный 3D-трансформер зрения (I3D-ViT) и Адаптивное разрешение кадров для восприятия потокового видео, что обеспечивает эффективное пространственно-временное представление и снижает затраты на обработку видеовходов во время обучения и инференса. Для результативности мы разрабатываем масштабируемый конвейер синтеза видеоданных, который формирует три разнообразных высококачественных набора данных для обучения: VideoChat3-Academic2M, VideoChat3-LV116K и VideoChat3-OL617K, охватывающих общие, длинные и потоковые видеосценарии, что улучшает обобщение модели между доменами. Интегрируя эти решения, VideoChat3 достигает редкого баланса между широкой обобщаемостью и вычислительной эффективностью. Эксперименты на общих, длинных и потоковых бенчмарках показывают, что VideoChat3 превосходит предыдущие открытые модели с равным или большим количеством параметров, имея всего 4B параметров и более высокую эффективность.
English
Recent advances in video understanding have spanned motion, long video, and streaming interaction, driving this field toward real-world applications. Despite this progress, current open-source models remain limited in several ways. They often struggle to generalize across diverse video types, making them effective only in specific domains. High computational demands further restrict their efficiency and scalability. Moreover, most models are only partially open, with key components such as training code, strategy, or datasets unavailable, which hinders reproducibility and slows community-driven development. To address these issues, we introduce VideoChat3, a fully open, efficient, and generalist video-centric MLLM. VideoChat3 advances video understanding through two complementary designs. For efficiency, we introduce Inflated 3D Vision Transformer (I3D-ViT) and Adaptive Frame Resolution for Streaming Video Perception, which enables efficient spatiotemporal representation and reduces the cost of processing video inputs during training and inference. For effectiveness, we develop a scalable video data synthesis pipeline that curates three diverse, high-quality training datasets: VideoChat3-Academic2M, VideoChat3-LV116K, and VideoChat3-OL617K, covering general, long-form, and streaming video scenarios, improving the model's generalization across domains. By integrating these designs, VideoChat3 achieves a rare balance of broad generalization and computational efficiency. Experiments across general, long-form, and streaming benchmarks demonstrate that VideoChat3 surpasses prior open-source models with equal or larger parameter counts with only 4B parameters and higher efficiency.
PDF1081July 18, 2026