Trabalhos de OCR Ilimitados
Unlimited OCR Works
June 22, 2026
Autores: Youyang Yin, Huanhuan Liu, YY, Qunyi Xie, Chaorun Liu, Shiqi Yang, Shaohua Wang, Zhanlong Liu, Hao Zou, Jinyue Chen, Shu Wei, Jingjing Wu, Mingxin Huang, Zhen Wu, Guibin Wang, Tengyu Du, Lei Jia
cs.AI
Resumo
Recentemente, modelos OCR ponta a ponta, exemplificados pelo DeepSeek OCR, colocaram novamente o OCR em destaque. Uma opinião amplamente difundida é que utilizar um modelo de linguagem grande (LLM) como decodificador permite que o modelo aproveite a distribuição a priori da linguagem, resultando em melhor desempenho do OCR. No entanto, a desvantagem é igualmente evidente: à medida que a sequência de saída se alonga, o cache KV acumulado aumenta o consumo de memória e desacelera progressivamente a geração. Isso contrasta fortemente com os humanos, que não apresentam tal declínio na eficiência durante tarefas de cópia de longo horizonte. Neste relatório técnico, propomos o Unlimited OCR, um modelo projetado para emular a memória de trabalho de parsing humano. Tomando o DeepSeek OCR como referência, substituímos todas as camadas de atenção no decodificador pela nossa proposta Atenção de Janela Deslizante de Referência (R-SWA), que reduz os custos de computação da atenção enquanto mantém um cache KV constante durante todo o processo de decodificação. Ao combinar a alta taxa de compressão do codificador do DeepSeek OCR com o nosso design de cache KV constante, o Unlimited OCR pode transcrever dezenas de páginas de documentos em uma única passagem direta sob um comprimento máximo padrão de 32K. Mais importante, a R-SWA é um mecanismo de atenção de parsing de propósito geral — além do OCR, é igualmente aplicável a tarefas como ASR, tradução, etc. Códigos e pesos do modelo estão disponíveis publicamente em http://github.com/baidu/Unlimited-OCR.
English
Recently, end-to-end OCR models, exemplified by DeepSeek OCR, have once again thrust OCR into the spotlight. A widely held view is that employing a large language model (LLM) as the decoder allows the model to leverage the prior distribution of language, leading to improved OCR performance. However, the downside is equally evident: as the output sequence lengthens, the accumulated KV cache drives up memory consumption and progressively slows down generation. This stands in stark contrast to humans, who exhibit no such decline in efficiency during long-horizon copying tasks. In this technical report, we propose Unlimited OCR, a model designed to emulate human parsing working memory. Taking DeepSeek OCR as the baseline, we replace all attention layers in the decoder with our proposed Reference Sliding Window Attention (R-SWA), which reduces attention computation costs while maintaining a constant KV cache throughout the entire decoding process. By combining the high compression rate of DeepSeek OCR's encoder with our constant KV cache design, Unlimited OCR can transcribe dozens of pages of documents in a single forward pass under a standard maximum length of 32K. More importantly, R-SWA is a general-purpose parsing attention mechanism - beyond OCR, it is equally applicable to tasks such as ASR, translation, etc. Codes and model weights are publicly available at http://github.com/baidu/Unlimited-OCR.