VideoChat3: Modello Linguistico Multimodale Video Completamente Aperto per una Comprensione Video Efficiente e Generalista
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
July 16, 2026
Autori: Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang
cs.AI
Abstract
I recenti progressi nella comprensione video hanno riguardato il movimento, i video lunghi e l'interazione in streaming, spingendo questo campo verso applicazioni reali. Nonostante questi progressi, gli attuali modelli open-source rimangono limitati sotto diversi aspetti. Spesso faticano a generalizzare su diverse tipologie di video, risultando efficaci solo in domini specifici. Le elevate richieste computazionali ne limitano ulteriormente l'efficienza e la scalabilità. Inoltre, la maggior parte dei modelli è solo parzialmente aperta, con componenti chiave come il codice di addestramento, la strategia o i dataset non disponibili, il che ostacola la riproducibilità e rallenta lo sviluppo guidato dalla comunità. Per affrontare questi problemi, presentiamo VideoChat3, un MLLM completamente aperto, efficiente e generalista incentrato sul video. VideoChat3 fa progredire la comprensione video attraverso due progetti complementari. Per l'efficienza, introduciamo il Vision Transformer 3D Inflato (I3D-ViT) e la Risoluzione Adattiva dei Fotogrammi per la Percezione Video in Streaming, che consentono una rappresentazione spaziotemporale efficiente e riducono il costo dell'elaborazione degli input video durante l'addestramento e l'inferenza. Per l'efficacia, sviluppiamo una pipeline scalabile di sintesi di dati video che cura tre dataset di addestramento diversificati e di alta qualità: VideoChat3-Academic2M, VideoChat3-LV116K e VideoChat3-OL617K, coprendo scenari video generali, di lunga durata e in streaming, migliorando la capacità di generalizzazione del modello tra diversi domini. Integrando questi progetti, VideoChat3 raggiunge un raro equilibrio tra ampia generalizzazione ed efficienza computazionale. Esperimenti condotti su benchmark generali, di lunga durata e in streaming dimostrano che VideoChat3 supera i precedenti modelli open-source con conteggio dei parametri uguale o maggiore, utilizzando solo 4B parametri e con maggiore efficienza.
English
Recent advances in video understanding have spanned motion, long video, and streaming interaction, driving this field toward real-world applications. Despite this progress, current open-source models remain limited in several ways. They often struggle to generalize across diverse video types, making them effective only in specific domains. High computational demands further restrict their efficiency and scalability. Moreover, most models are only partially open, with key components such as training code, strategy, or datasets unavailable, which hinders reproducibility and slows community-driven development. To address these issues, we introduce VideoChat3, a fully open, efficient, and generalist video-centric MLLM. VideoChat3 advances video understanding through two complementary designs. For efficiency, we introduce Inflated 3D Vision Transformer (I3D-ViT) and Adaptive Frame Resolution for Streaming Video Perception, which enables efficient spatiotemporal representation and reduces the cost of processing video inputs during training and inference. For effectiveness, we develop a scalable video data synthesis pipeline that curates three diverse, high-quality training datasets: VideoChat3-Academic2M, VideoChat3-LV116K, and VideoChat3-OL617K, covering general, long-form, and streaming video scenarios, improving the model's generalization across domains. By integrating these designs, VideoChat3 achieves a rare balance of broad generalization and computational efficiency. Experiments across general, long-form, and streaming benchmarks demonstrate that VideoChat3 surpasses prior open-source models with equal or larger parameter counts with only 4B parameters and higher efficiency.