HunyuanOCR-1.5: Ускорение и улучшение легковесных OCR VLMs
HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
July 6, 2026
Авторы: Gengluo Li, Xingyu Wan, Shangpin Peng, Weinong Wang, Hao Feng, Yongkun Du, Binghong Wu, Zheng Ruan, Zhiqiong Lu, Liang Wu, Pengyuan Lyu, Huawen Shen, Zibin Lin, Shijing Hu, Jieneng Yang, Hongbing Wen, Guanghua Yu, Hong Liu, Bochao Wang, Can Ma, Han Hu, Chengquan Zhang, Yu Zhou
cs.AI
Аннотация
Мы представляем HunyuanOCR-1.5 — легковесную сквозную модель зрения-языка, специализированную на OCR. HunyuanOCR объединяет в рамках единой сквозной VLM такие задачи, как разбор документов, обнаружение текста, извлечение информации, перевод текста с изображения и понимание документов на основе нескольких изображений. Опираясь на легковесную архитектуру HunyuanOCR-1.0, HunyuanOCR-1.5 не перерабатывает магистраль, а систематически улучшает как эффективность, так и функциональные возможности. Для повышения эффективности мы адаптируем DFlash для декодирования OCR, что значительно снижает задержку при формировании длинных структурированных выходных данных, таких как плотные документы, таблицы и формулы, сохраняя при этом распределение результатов. Благодаря DFlash HunyuanOCR-1.5 достигает ускорения вывода Transformer в 6,37 раза и ускорения в 2,14 раза при работе с vLLM, обеспечивая тем самым самый быстрый вывод среди легковесных OCR VLM. Для расширения функциональных возможностей мы предлагаем Agentic Data Flow — агентно-управляемую систему конструирования данных, которая преобразует слабые стороны модели в выполнимые требования к данным и автономно выполняет поиск материалов, проверку качества и разработку конвейеров. Это существенно улучшает возможности в области длиннохвостых задач: OCR древних письменностей, детального анализа диаграмм и таблиц, вопросно-ответных систем, ориентированных на текст на нескольких изображениях, многозыкового разбора при ограниченных ресурсах, а также оценки галлюцинаций в документах. HunyuanOCR-1.5 входит в число лучших сквозных OCR-решений на OmniDocBench v1.6, одновременно устанавливая новые рекорды производительности в этих длиннохвостых задачах. В сочетании с обновленной методикой предварительного и последующего обучения HunyuanOCR-1.5 дополнительно расширяет свои возможности в сценариях с высоким разрешением, длинным контекстом и несколькими задачами. Эксперименты демонстрируют более быстрый вывод, более широкий охват возможностей OCR и преимущества развертывания легковесной сквозной модели. Мы планируем выпустить веса модели и код обучения для поддержки будущих исследований и реальных приложений OCR.
English
We present HunyuanOCR-1.5, a lightweight end-to-end OCR-specialized vision-language model. HunyuanOCR unifies document parsing, text spotting, information extraction, text-image translation, and multi-image document understanding within a single end-to-end VLM. Building upon the lightweight architecture of HunyuanOCR-1.0, HunyuanOCR-1.5 does not redesign the backbone, but systematically improves both efficiency and capability. For efficiency, we adapt DFlash to OCR decoding, significantly reducing the latency of long structured outputs such as dense documents, tables, and formulas while preserving output distribution. Powered by DFlash, HunyuanOCR-1.5 achieves a 6.37x Transformer inference speedup and a 2.14x speedup under vLLM, delivering the fastest inference among lightweight OCR VLMs. For capability, we propose Agentic Data Flow, an agent-driven data construction system that transforms model weaknesses into executable data requirements and autonomously performs material search, quality verification, and pipeline development. It substantially improves long-tail capabilities in ancient-script OCR, fine-grained chart and table parsing, multi-image text-centric QA, low-resource multilingual parsing, and document hallucination evaluation. HunyuanOCR-1.5 ranks among the top-tier end-to-end OCR solutions on OmniDocBench v1.6 while achieving new performance milestones across these long-tail tasks. Combined with an upgraded pretraining and post-training recipe, HunyuanOCR-1.5 further extends its capability in high-resolution, long-context, and multi-task scenarios. Experiments demonstrate faster inference, broader OCR capability coverage, and the deployment advantages of a lightweight end-to-end model. We will release the model weights and training code to support future research and real-world OCR applications.