ChatPaper.aiChatPaper

HunyuanOCR-1.5: Haciendo más rápidos y mejores los modelos VLM ligeros de OCR

HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better

July 6, 2026
Autores: Gengluo Li, Xingyu Wan, Shangpin Peng, Weinong Wang, Hao Feng, Yongkun Du, Binghong Wu, Zheng Ruan, Zhiqiong Lu, Liang Wu, Pengyuan Lyu, Huawen Shen, Zibin Lin, Shijing Hu, Jieneng Yang, Hongbing Wen, Guanghua Yu, Hong Liu, Bochao Wang, Can Ma, Han Hu, Chengquan Zhang, Yu Zhou
cs.AI

Resumen

Presentamos HunyuanOCR-1.5, un modelo ligero de lenguaje visual especializado en OCR de extremo a extremo. HunyuanOCR unifica el análisis de documentos, la detección de texto, la extracción de información, la traducción texto-imagen y la comprensión de documentos multiimagen en un único VLM de extremo a extremo. Basado en la arquitectura ligera de HunyuanOCR-1.0, HunyuanOCR-1.5 no rediseña el backbone, sino que mejora sistemáticamente tanto la eficiencia como la capacidad. En cuanto a eficiencia, adaptamos DFlash a la decodificación OCR, reduciendo significativamente la latencia de salidas estructuradas largas, como documentos densos, tablas y fórmulas, preservando la distribución de salida. Gracias a DFlash, HunyuanOCR-1.5 logra una aceleración de inferencia de Transformer de 6.37x y una aceleración de 2.14x bajo vLLM, ofreciendo la inferencia más rápida entre los VLM OCR ligeros. En cuanto a capacidad, proponemos Agentic Data Flow, un sistema de construcción de datos impulsado por agentes que transforma las debilidades del modelo en requisitos de datos ejecutables y realiza de forma autónoma búsqueda de materiales, verificación de calidad y desarrollo de pipelines. Esto mejora sustancialmente las capacidades de larga cola en OCR de escrituras antiguas, análisis detallado de gráficos y tablas, QA textual centrado en imágenes múltiples, análisis multilingüe con pocos recursos y evaluación de alucinaciones en documentos. HunyuanOCR-1.5 se sitúa entre las soluciones OCR de extremo a extremo de primer nivel en OmniDocBench v1.6, al tiempo que alcanza nuevos hitos de rendimiento en estas tareas de larga cola. Combinado con una receta mejorada de preentrenamiento y postentrenamiento, HunyuanOCR-1.5 extiende aún más su capacidad en escenarios de alta resolución, contexto largo y multitarea. Los experimentos demuestran una inferencia más rápida, una cobertura de capacidades OCR más amplia y las ventajas de implementación de un modelo ligero de extremo a extremo. Publicaremos los pesos del modelo y el código de entrenamiento para apoyar futuras investigaciones y aplicaciones OCR en el mundo real.
English
We present HunyuanOCR-1.5, a lightweight end-to-end OCR-specialized vision-language model. HunyuanOCR unifies document parsing, text spotting, information extraction, text-image translation, and multi-image document understanding within a single end-to-end VLM. Building upon the lightweight architecture of HunyuanOCR-1.0, HunyuanOCR-1.5 does not redesign the backbone, but systematically improves both efficiency and capability. For efficiency, we adapt DFlash to OCR decoding, significantly reducing the latency of long structured outputs such as dense documents, tables, and formulas while preserving output distribution. Powered by DFlash, HunyuanOCR-1.5 achieves a 6.37x Transformer inference speedup and a 2.14x speedup under vLLM, delivering the fastest inference among lightweight OCR VLMs. For capability, we propose Agentic Data Flow, an agent-driven data construction system that transforms model weaknesses into executable data requirements and autonomously performs material search, quality verification, and pipeline development. It substantially improves long-tail capabilities in ancient-script OCR, fine-grained chart and table parsing, multi-image text-centric QA, low-resource multilingual parsing, and document hallucination evaluation. HunyuanOCR-1.5 ranks among the top-tier end-to-end OCR solutions on OmniDocBench v1.6 while achieving new performance milestones across these long-tail tasks. Combined with an upgraded pretraining and post-training recipe, HunyuanOCR-1.5 further extends its capability in high-resolution, long-context, and multi-task scenarios. Experiments demonstrate faster inference, broader OCR capability coverage, and the deployment advantages of a lightweight end-to-end model. We will release the model weights and training code to support future research and real-world OCR applications.