VideoChat3: Volledig Open Video MLLM voor Efficiënt en Generalistisch Videobegrip
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
July 16, 2026
Auteurs: Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang
cs.AI
Samenvatting
Recente vooruitgangen in videobegrip strekken zich uit over beweging, lange video's en streaminteractie, wat dit veld richting praktische toepassingen stuurt. Ondanks deze vooruitgang blijven huidige open-source modellen op verschillende manieren beperkt. Ze hebben vaak moeite om te generaliseren over diverse videotypes, waardoor ze alleen effectief zijn in specifieke domeinen. Hoge rekenkundige eisen beperken verder hun efficiëntie en schaalbaarheid. Bovendien zijn de meeste modellen slechts gedeeltelijk open, waarbij belangrijke componenten zoals trainingscode, strategie of datasets niet beschikbaar zijn, wat reproduceerbaarheid belemmert en de door de gemeenschap gedreven ontwikkeling vertraagt.
Om deze problemen aan te pakken, introduceren we VideoChat3, een volledig open, efficiënt en generalistisch video-gecentreerd MLLM. VideoChat3 bevordert videobegrip door twee complementaire ontwerpen. Voor efficiëntie introduceren we Inflated 3D Vision Transformer (I3D-ViT) en Adaptive Frame Resolution for Streaming Video Perception, wat efficiënte spatiotemporele representatie mogelijk maakt en de kosten van het verwerken van video-invoer tijdens training en inferentie verlaagt. Voor effectiviteit ontwikkelen we een schaalbare pijplijn voor videosynthese die drie diverse, hoogwaardige trainingsdatasets samenstelt: VideoChat3-Academic2M, VideoChat3-LV116K en VideoChat3-OL617K, die algemene, lange en streamende videoscenario's bestrijken, wat de generalisatie van het model over domeinen verbetert.
Door deze ontwerpen te integreren, bereikt VideoChat3 een zeldzame balans tussen brede generalisatie en computationele efficiëntie. Experimenten over algemene, lange en streamende benchmarks tonen aan dat VideoChat3 eerdere open-source modellen met gelijke of grotere parameteraantallen overtreft met slechts 4B parameters en een hogere efficiëntie.
English
Recent advances in video understanding have spanned motion, long video, and streaming interaction, driving this field toward real-world applications. Despite this progress, current open-source models remain limited in several ways. They often struggle to generalize across diverse video types, making them effective only in specific domains. High computational demands further restrict their efficiency and scalability. Moreover, most models are only partially open, with key components such as training code, strategy, or datasets unavailable, which hinders reproducibility and slows community-driven development. To address these issues, we introduce VideoChat3, a fully open, efficient, and generalist video-centric MLLM. VideoChat3 advances video understanding through two complementary designs. For efficiency, we introduce Inflated 3D Vision Transformer (I3D-ViT) and Adaptive Frame Resolution for Streaming Video Perception, which enables efficient spatiotemporal representation and reduces the cost of processing video inputs during training and inference. For effectiveness, we develop a scalable video data synthesis pipeline that curates three diverse, high-quality training datasets: VideoChat3-Academic2M, VideoChat3-LV116K, and VideoChat3-OL617K, covering general, long-form, and streaming video scenarios, improving the model's generalization across domains. By integrating these designs, VideoChat3 achieves a rare balance of broad generalization and computational efficiency. Experiments across general, long-form, and streaming benchmarks demonstrate that VideoChat3 surpasses prior open-source models with equal or larger parameter counts with only 4B parameters and higher efficiency.