HunyuanOCR-1.5 : Rendre les VLMs OCR légers plus rapides et meilleurs
HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
July 6, 2026
Auteurs: Gengluo Li, Xingyu Wan, Shangpin Peng, Weinong Wang, Hao Feng, Yongkun Du, Binghong Wu, Zheng Ruan, Zhiqiong Lu, Liang Wu, Pengyuan Lyu, Huawen Shen, Zibin Lin, Shijing Hu, Jieneng Yang, Hongbing Wen, Guanghua Yu, Hong Liu, Bochao Wang, Can Ma, Han Hu, Chengquan Zhang, Yu Zhou
cs.AI
Résumé
Nous présentons HunyuanOCR-1.5, un modèle vision-langage léger spécialisé en OCR de bout en bout. HunyuanOCR unifie l'analyse de documents, le repérage de texte, l'extraction d'informations, la traduction texte-image et la compréhension de documents multi-images au sein d'un unique VLM de bout en bout. S'appuyant sur l'architecture légère de HunyuanOCR-1.0, HunyuanOCR-1.5 ne reconçoit pas l'architecture de base, mais améliore systématiquement à la fois l'efficacité et la capacité. Pour l'efficacité, nous adaptons DFlash au décodage OCR, réduisant significativement la latence des sorties structurées longues telles que les documents denses, les tableaux et les formules, tout en préservant la distribution des sorties. Propulsé par DFlash, HunyuanOCR-1.5 atteint une accélération de 6,37× de l'inférence Transformer et une accélération de 2,14× sous vLLM, offrant l'inférence la plus rapide parmi les VLM OCR légers. Pour la capacité, nous proposons Agentic Data Flow, un système de construction de données piloté par des agents qui transforme les faiblesses du modèle en exigences de données exécutables et effectue de manière autonome la recherche de matériel, la vérification de qualité et le développement de pipelines. Il améliore substantiellement les capacités de long-tail en OCR d'écritures anciennes, l'analyse fine des graphiques et tableaux, le question-réponse textocentrique multi-images, l'analyse multilingue à faibles ressources et l'évaluation des hallucinations documentaires. HunyuanOCR-1.5 se classe parmi les solutions OCR de bout en bout de premier plan sur OmniDocBench v1.6 tout en atteignant de nouveaux jalons de performance dans ces tâches de long-tail. Combiné à une recette de pré-entraînement et de post-entraînement améliorée, HunyuanOCR-1.5 étend encore ses capacités dans les scénarios haute résolution, long contexte et multi-tâches. Les expériences démontrent une inférence plus rapide, une couverture plus large des capacités OCR et les avantages de déploiement d'un modèle léger de bout en bout. Nous publierons les poids du modèle et le code d'entraînement pour soutenir la recherche future et les applications OCR réelles.
English
We present HunyuanOCR-1.5, a lightweight end-to-end OCR-specialized vision-language model. HunyuanOCR unifies document parsing, text spotting, information extraction, text-image translation, and multi-image document understanding within a single end-to-end VLM. Building upon the lightweight architecture of HunyuanOCR-1.0, HunyuanOCR-1.5 does not redesign the backbone, but systematically improves both efficiency and capability. For efficiency, we adapt DFlash to OCR decoding, significantly reducing the latency of long structured outputs such as dense documents, tables, and formulas while preserving output distribution. Powered by DFlash, HunyuanOCR-1.5 achieves a 6.37x Transformer inference speedup and a 2.14x speedup under vLLM, delivering the fastest inference among lightweight OCR VLMs. For capability, we propose Agentic Data Flow, an agent-driven data construction system that transforms model weaknesses into executable data requirements and autonomously performs material search, quality verification, and pipeline development. It substantially improves long-tail capabilities in ancient-script OCR, fine-grained chart and table parsing, multi-image text-centric QA, low-resource multilingual parsing, and document hallucination evaluation. HunyuanOCR-1.5 ranks among the top-tier end-to-end OCR solutions on OmniDocBench v1.6 while achieving new performance milestones across these long-tail tasks. Combined with an upgraded pretraining and post-training recipe, HunyuanOCR-1.5 further extends its capability in high-resolution, long-context, and multi-task scenarios. Experiments demonstrate faster inference, broader OCR capability coverage, and the deployment advantages of a lightweight end-to-end model. We will release the model weights and training code to support future research and real-world OCR applications.