ChatPaper.aiChatPaper

HunyuanOCR-1.5: Lichtgewicht OCR-VLM's sneller en beter maken

HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better

July 6, 2026
Auteurs: Gengluo Li, Xingyu Wan, Shangpin Peng, Weinong Wang, Hao Feng, Yongkun Du, Binghong Wu, Zheng Ruan, Zhiqiong Lu, Liang Wu, Pengyuan Lyu, Huawen Shen, Zibin Lin, Shijing Hu, Jieneng Yang, Hongbing Wen, Guanghua Yu, Hong Liu, Bochao Wang, Can Ma, Han Hu, Chengquan Zhang, Yu Zhou
cs.AI

Samenvatting

We presenteren HunyuanOCR-1.5, een lichtgewicht end-to-end visie-taalmodel gespecialiseerd in OCR. HunyuanOCR verenigt documentparsing, tekstherkenning, informatie-extractie, tekst-beeldvertaling en meervoudig beelddocumentbegrip binnen één enkel end-to-end VLM. Voortbouwend op de lichtgewicht architectuur van HunyuanOCR-1.0 herontwerpt HunyuanOCR-1.5 niet de backbone, maar verbetert het systematisch zowel efficiëntie als capaciteit. Voor efficiëntie passen we DFlash aan voor OCR-decodering, wat de latentie van lange gestructureerde uitvoer zoals dichte documenten, tabellen en formules aanzienlijk vermindert, terwijl de uitvoerverdeling behouden blijft. Dankzij DFlash behaalt HunyuanOCR-1.5 een 6,37x versnelling van de Transformer-inferentie en een 2,14x versnelling onder vLLM, wat de snelste inferentie levert onder lichtgewicht OCR-VLM's. Voor capaciteit introduceren we Agentic Data Flow, een agent-gestuurd dataconstructiesysteem dat modelzwaktes omzet in uitvoerbare datavereisten en autonoom materiaal zoeken, kwaliteitsverificatie en pijplijnontwikkeling uitvoert. Het verbetert substantieel de lange-staartcapaciteiten in oud-schrift OCR, fijnmazige grafiek- en tabelparsing, meervoudig beeld tekstgerichte QA, meertalige parsing met weinig bronnen, en documenthallucinatie-evaluatie. HunyuanOCR-1.5 behoort tot de top end-to-end OCR-oplossingen op OmniDocBench v1.6 en behaalt nieuwe prestatiedrempels in deze lange-staarttaken. In combinatie met een verbeterd recept voor pretraining en post-training breidt HunyuanOCR-1.5 zijn capaciteit verder uit in scenario's met hoge resolutie, lange context en meerdere taken. Experimenten tonen snellere inferentie, bredere OCR-capaciteitsdekking en de implementatievoordelen van een lichtgewicht end-to-end model. We zullen de modelgewichten en trainingscode vrijgeven om toekomstig onderzoek en praktijktoepassingen van OCR te ondersteunen.
English
We present HunyuanOCR-1.5, a lightweight end-to-end OCR-specialized vision-language model. HunyuanOCR unifies document parsing, text spotting, information extraction, text-image translation, and multi-image document understanding within a single end-to-end VLM. Building upon the lightweight architecture of HunyuanOCR-1.0, HunyuanOCR-1.5 does not redesign the backbone, but systematically improves both efficiency and capability. For efficiency, we adapt DFlash to OCR decoding, significantly reducing the latency of long structured outputs such as dense documents, tables, and formulas while preserving output distribution. Powered by DFlash, HunyuanOCR-1.5 achieves a 6.37x Transformer inference speedup and a 2.14x speedup under vLLM, delivering the fastest inference among lightweight OCR VLMs. For capability, we propose Agentic Data Flow, an agent-driven data construction system that transforms model weaknesses into executable data requirements and autonomously performs material search, quality verification, and pipeline development. It substantially improves long-tail capabilities in ancient-script OCR, fine-grained chart and table parsing, multi-image text-centric QA, low-resource multilingual parsing, and document hallucination evaluation. HunyuanOCR-1.5 ranks among the top-tier end-to-end OCR solutions on OmniDocBench v1.6 while achieving new performance milestones across these long-tail tasks. Combined with an upgraded pretraining and post-training recipe, HunyuanOCR-1.5 further extends its capability in high-resolution, long-context, and multi-task scenarios. Experiments demonstrate faster inference, broader OCR capability coverage, and the deployment advantages of a lightweight end-to-end model. We will release the model weights and training code to support future research and real-world OCR applications.