ChatPaper.aiChatPaper

HunyuanOCR-1.5: Tornando Modelos de Linguagem Visual Leves para OCR Mais Rápidos e Melhores

HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better

July 6, 2026
Autores: Gengluo Li, Xingyu Wan, Shangpin Peng, Weinong Wang, Hao Feng, Yongkun Du, Binghong Wu, Zheng Ruan, Zhiqiong Lu, Liang Wu, Pengyuan Lyu, Huawen Shen, Zibin Lin, Shijing Hu, Jieneng Yang, Hongbing Wen, Guanghua Yu, Hong Liu, Bochao Wang, Can Ma, Han Hu, Chengquan Zhang, Yu Zhou
cs.AI

Resumo

Apresentamos o HunyuanOCR-1.5, um modelo de visão-linguagem leve e especializado em OCR de ponta a ponta. O HunyuanOCR unifica análise de documentos, detecção de texto, extração de informações, tradução texto-imagem e compreensão de documentos multi-imagem em um único VLM de ponta a ponta. Baseado na arquitetura leve do HunyuanOCR-1.0, o HunyuanOCR-1.5 não redesenha o backbone, mas melhora sistematicamente tanto a eficiência quanto a capacidade. Para eficiência, adaptamos o DFlash à decodificação de OCR, reduzindo significativamente a latência de saídas estruturadas longas, como documentos densos, tabelas e fórmulas, preservando a distribuição de saída. Impulsionado pelo DFlash, o HunyuanOCR-1.5 alcança um ganho de 6,37x na inferência Transformer e 2,14x sob vLLM, oferecendo a inferência mais rápida entre VLMs OCR leves. Para capacidade, propomos o Fluxo de Dados Agentivo (Agentic Data Flow), um sistema de construção de dados orientado por agente que transforma fraquezas do modelo em requisitos de dados executáveis e realiza de forma autônoma busca de materiais, verificação de qualidade e desenvolvimento de pipelines. Isso melhora substancialmente as capacidades de cauda longa em OCR de escritas antigas, análise detalhada de gráficos e tabelas, QA centrado em texto multi-imagem, análise multilíngue com poucos recursos e avaliação de alucinação documental. O HunyuanOCR-1.5 está entre as soluções de OCR ponta a ponta de alto nível no OmniDocBench v1.6, ao mesmo tempo que atinge novos marcos de desempenho nessas tarefas de cauda longa. Combinado com uma receita atualizada de pré-treinamento e pós-treinamento, o HunyuanOCR-1.5 estende ainda mais sua capacidade em cenários de alta resolução, contexto longo e multitarefa. Os experimentos demonstram inferência mais rápida, cobertura mais ampla de capacidade de OCR e as vantagens de implantação de um modelo leve de ponta a ponta. Disponibilizaremos os pesos do modelo e o código de treinamento para apoiar futuras pesquisas e aplicações reais de OCR.
English
We present HunyuanOCR-1.5, a lightweight end-to-end OCR-specialized vision-language model. HunyuanOCR unifies document parsing, text spotting, information extraction, text-image translation, and multi-image document understanding within a single end-to-end VLM. Building upon the lightweight architecture of HunyuanOCR-1.0, HunyuanOCR-1.5 does not redesign the backbone, but systematically improves both efficiency and capability. For efficiency, we adapt DFlash to OCR decoding, significantly reducing the latency of long structured outputs such as dense documents, tables, and formulas while preserving output distribution. Powered by DFlash, HunyuanOCR-1.5 achieves a 6.37x Transformer inference speedup and a 2.14x speedup under vLLM, delivering the fastest inference among lightweight OCR VLMs. For capability, we propose Agentic Data Flow, an agent-driven data construction system that transforms model weaknesses into executable data requirements and autonomously performs material search, quality verification, and pipeline development. It substantially improves long-tail capabilities in ancient-script OCR, fine-grained chart and table parsing, multi-image text-centric QA, low-resource multilingual parsing, and document hallucination evaluation. HunyuanOCR-1.5 ranks among the top-tier end-to-end OCR solutions on OmniDocBench v1.6 while achieving new performance milestones across these long-tail tasks. Combined with an upgraded pretraining and post-training recipe, HunyuanOCR-1.5 further extends its capability in high-resolution, long-context, and multi-task scenarios. Experiments demonstrate faster inference, broader OCR capability coverage, and the deployment advantages of a lightweight end-to-end model. We will release the model weights and training code to support future research and real-world OCR applications.