ChatPaper.aiChatPaper

Entraînement efficace de modèles vision-langage à long contexte avec généralisation au-delà de 128K de contexte

Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context

May 13, 2026
Auteurs: Zhaowei Wang, Lishu Luo, Haodong Duan, Weiwei Liu, Sijin Wu, Ji Luo, Shen Yan, Shuai Peng, Sihang Yuan, Chaoyi Huang, Yi Lin, Yangqiu Song
cs.AI

Résumé

La modélisation à long contexte devient une capacité centrale des grands modèles vision-langage (LVLM) modernes, permettant une gestion soutenue du contexte dans la compréhension de longs documents, l’analyse vidéo et l’utilisation d’outils multi-tours au sein de workflows agentiques. Pourtant, les recettes d’entraînement pratiques restent insuffisamment explorées, en particulier pour la conception et l’équilibrage des mélanges de données à long contexte. Dans ce travail, nous présentons une étude systématique du pré-entraînement continu à long contexte pour les LVLM, en étendant un modèle 7B de 32K à 128K de contexte avec des ablations approfondies sur les données de longs documents. Nous montrons d’abord que le VQA sur longs documents est nettement plus efficace que la transcription OCR. En nous appuyant sur cette observation, nos ablations révèlent en outre trois résultats clés : i) pour la distribution de la longueur des séquences, les données équilibrées surpassent les données ciblant une longueur spécifique (par exemple, 128K), suggérant que la capacité à long contexte nécessite une récupération généralisable d’informations clés à travers différentes longueurs et positions ; ii) la récupération reste le principal goulot d’étranglement, favorisant les mélanges axés sur la récupération avec des données de raisonnement modestes pour la diversité des tâches ; et iii) le VQA pur sur longs documents préserve largement les capacités à court contexte, suggérant que les données longues formatées en instructions réduisent le besoin de mélange avec des données courtes. Sur la base de ces résultats, nous présentons MMProLong, obtenu par pré-entraînement continu à long contexte à partir de Qwen2.5-VL-7B avec seulement un budget de 5B tokens. MMProLong améliore les scores de VQA sur longs documents de 7,1 % et maintient des performances solides à des contextes de 256K et 512K au-delà de sa fenêtre d’entraînement de 128K, sans entraînement supplémentaire. Il se généralise en outre à la récupération d’aiguilles multimodales sur pages web, à la compression vision-texte à long contexte et à la compréhension de longues vidéos sans supervision spécifique à la tâche. Dans l’ensemble, notre étude établit une recette LongPT pratique et une base empirique pour faire progresser les modèles vision-langage à long contexte.
English
Long-context modeling is becoming a core capability of modern large vision-language models (LVLMs), enabling sustained context management across long-document understanding, video analysis, and multi-turn tool use in agentic workflows. Yet practical training recipes remain insufficiently explored, particularly for designing and balancing long-context data mixtures. In this work, we present a systematic study of long-context continued pre-training for LVLMs, extending a 7B model from 32K to 128K context with extensive ablations on long-document data. We first show that long-document VQA is substantially more effective than OCR transcription. Building on this observation, our ablations further yield three key findings: i) for sequence-length distribution, balanced data outperforms target-length-focused data (e.g., 128K), suggesting that long-context ability requires generalizable key-information retrieval across various lengths and positions; ii) retrieval remains the primary bottleneck, favoring retrieval-heavy mixtures with modest reasoning data for task diversity; and iii) pure long-document VQA largely preserves short-context capabilities, suggesting that instruction-formatted long data reduces the need for short-data mixing. Based on these findings, we introduce MMProLong, obtained by long-context continued pre-training from Qwen2.5-VL-7B with only a 5B-token budget. MMProLong improves long-document VQA scores by 7.1% and maintains strong performance at 256K and 512K contexts beyond its 128K training window, without additional training. It further generalizes to webpage-based multimodal needle retrieval, long-context vision-text compression, and long-video understanding without task-specific supervision. Overall, our study establishes a practical LongPT recipe and an empirical foundation for advancing long-context vision-language models.