VideoChat3 : Un MLLM vidéo entièrement ouvert pour une compréhension vidéo efficace et généraliste

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

July 16, 2026
Auteurs: Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang
cs.AI

Résumé

Les récentes avancées dans la compréhension vidéo ont couvert le mouvement, les vidéos longues et l'interaction en streaming, orientant ce domaine vers des applications concrètes. Malgré ces progrès, les modèles open-source actuels restent limités à plusieurs égards. Ils peinent souvent à généraliser sur divers types de vidéos, ce qui les rend efficaces uniquement dans des domaines spécifiques. Leurs coûts de calcul élevés restreignent en outre leur efficacité et leur évolutivité. De plus, la plupart des modèles ne sont que partiellement ouverts, des composants clés tels que le code d’entraînement, la stratégie ou les jeux de données étant indisponibles, ce qui entrave la reproductibilité et ralentit le développement communautaire. Pour remédier à ces problèmes, nous présentons VideoChat3, un MLLM (modèle de langage multimodal de grande taille) entièrement ouvert, efficace et généraliste centré sur la vidéo. VideoChat3 fait progresser la compréhension vidéo grâce à deux conceptions complémentaires. Pour l’efficacité, nous introduisons le Vision Transformer 3D gonflé (I3D-ViT) et la résolution adaptative des trames pour la perception vidéo en streaming, qui permettent une représentation spatiotemporelle efficace et réduisent le coût de traitement des entrées vidéo pendant l’entraînement et l’inférence. Pour l’efficacité (au sens d’efficacité opérationnelle), nous développons un pipeline de synthèse de données vidéo scalable qui produit trois jeux de données d’entraînement diversifiés et de haute qualité : VideoChat3-Academic2M, VideoChat3-LV116K et VideoChat3-OL617K, couvrant des scénarios vidéo généraux, longs et en streaming, améliorant ainsi la généralisation du modèle entre les domaines. En intégrant ces conceptions, VideoChat3 atteint un équilibre rare entre généralisation étendue et efficacité de calcul. Des expériences menées sur des références générales, longues et en streaming montrent que VideoChat3 surpasse les modèles open-source antérieurs avec des nombres de paramètres égaux ou supérieurs, avec seulement 4 milliards de paramètres et une efficacité accrue.
English
Recent advances in video understanding have spanned motion, long video, and streaming interaction, driving this field toward real-world applications. Despite this progress, current open-source models remain limited in several ways. They often struggle to generalize across diverse video types, making them effective only in specific domains. High computational demands further restrict their efficiency and scalability. Moreover, most models are only partially open, with key components such as training code, strategy, or datasets unavailable, which hinders reproducibility and slows community-driven development. To address these issues, we introduce VideoChat3, a fully open, efficient, and generalist video-centric MLLM. VideoChat3 advances video understanding through two complementary designs. For efficiency, we introduce Inflated 3D Vision Transformer (I3D-ViT) and Adaptive Frame Resolution for Streaming Video Perception, which enables efficient spatiotemporal representation and reduces the cost of processing video inputs during training and inference. For effectiveness, we develop a scalable video data synthesis pipeline that curates three diverse, high-quality training datasets: VideoChat3-Academic2M, VideoChat3-LV116K, and VideoChat3-OL617K, covering general, long-form, and streaming video scenarios, improving the model's generalization across domains. By integrating these designs, VideoChat3 achieves a rare balance of broad generalization and computational efficiency. Experiments across general, long-form, and streaming benchmarks demonstrate that VideoChat3 surpasses prior open-source models with equal or larger parameter counts with only 4B parameters and higher efficiency.
PDF1081July 18, 2026