VideoChat3: MLLM de video completamente abierto para una comprensión de video eficiente y generalista

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

July 16, 2026
Autores: Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang
cs.AI

Resumen

Los avances recientes en la comprensión de vídeos han abarcado el movimiento, los vídeos de larga duración y la interacción en streaming, impulsando este campo hacia aplicaciones del mundo real. A pesar de este progreso, los modelos actuales de código abierto presentan varias limitaciones. A menudo tienen dificultades para generalizar entre diversos tipos de vídeo, lo que los hace efectivos solo en dominios específicos. Las altas demandas computacionales restringen aún más su eficiencia y escalabilidad. Además, la mayoría de los modelos son solo parcialmente abiertos, con componentes clave como el código de entrenamiento, la estrategia o los conjuntos de datos no disponibles, lo que dificulta la reproducibilidad y ralentiza el desarrollo impulsado por la comunidad. Para abordar estos problemas, presentamos VideoChat3, un MLLM (Modelo de Lenguaje Grande Multimodal) completamente abierto, eficiente y generalista centrado en vídeo. VideoChat3 avanza en la comprensión de vídeos mediante dos diseños complementarios. En cuanto a la eficiencia, introducimos el Transformer de Visión 3D Inflado (I3D-ViT) y la Resolución Adaptativa de Fotogramas para la Percepción de Vídeo en Streaming, lo que permite una representación espacio-temporal eficiente y reduce el costo de procesar entradas de vídeo durante el entrenamiento y la inferencia. En cuanto a la efectividad, desarrollamos un pipeline escalable de síntesis de datos de vídeo que selecciona tres conjuntos de datos de entrenamiento diversos y de alta calidad: VideoChat3-Academic2M, VideoChat3-LV116K y VideoChat3-OL617K, que cubren escenarios de vídeo general, de larga duración y en streaming, mejorando la generalización del modelo entre dominios. Al integrar estos diseños, VideoChat3 logra un equilibrio poco común entre una amplia generalización y la eficiencia computacional. Experimentos en benchmarks generales, de larga duración y en streaming demuestran que VideoChat3 supera a modelos previos de código abierto con un número igual o mayor de parámetros, utilizando solo 4 mil millones de parámetros y con mayor eficiencia.
English
Recent advances in video understanding have spanned motion, long video, and streaming interaction, driving this field toward real-world applications. Despite this progress, current open-source models remain limited in several ways. They often struggle to generalize across diverse video types, making them effective only in specific domains. High computational demands further restrict their efficiency and scalability. Moreover, most models are only partially open, with key components such as training code, strategy, or datasets unavailable, which hinders reproducibility and slows community-driven development. To address these issues, we introduce VideoChat3, a fully open, efficient, and generalist video-centric MLLM. VideoChat3 advances video understanding through two complementary designs. For efficiency, we introduce Inflated 3D Vision Transformer (I3D-ViT) and Adaptive Frame Resolution for Streaming Video Perception, which enables efficient spatiotemporal representation and reduces the cost of processing video inputs during training and inference. For effectiveness, we develop a scalable video data synthesis pipeline that curates three diverse, high-quality training datasets: VideoChat3-Academic2M, VideoChat3-LV116K, and VideoChat3-OL617K, covering general, long-form, and streaming video scenarios, improving the model's generalization across domains. By integrating these designs, VideoChat3 achieves a rare balance of broad generalization and computational efficiency. Experiments across general, long-form, and streaming benchmarks demonstrate that VideoChat3 surpasses prior open-source models with equal or larger parameter counts with only 4B parameters and higher efficiency.
PDF1081July 18, 2026