ChatPaper.aiChatPaper

PerceptionDLM: Percepção Paralela de Regiões com Modelos de Linguagem de Difusão Multimodal

PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models

June 17, 2026
Autores: Yueyi Sun, Yuhao Wang, Jason Li, Ye Tian, Tao Zhang, Jacky Mai, Yihan Wang, Haochen Wang, Jinbin Bai, Ling Yang, Yunhai Tong
cs.AI

Resumo

Modelos de linguagem grandes multimodais (MLLMs) têm alcançado progressos notáveis em tarefas de compreensão visual. No entanto, a maioria dos MLLMs existentes depende de geração autorregressiva, o que limita sua eficiência para tarefas de percepção que exigem a descrição de múltiplas regiões. Neste trabalho, propomos o PerceptionDLM, um modelo de linguagem multimodal por difusão otimizado para percepção paralela eficiente de regiões. Construído sobre o PerceptionDLM-Base, uma forte linha de base fundamental que alcança desempenho de estado da arte entre os MLLMs de difusão de código aberto, nossa arquitetura aproveita plenamente a natureza de decodificação paralela dos DLMs. Especificamente, introduzimos prompting eficiente e mascaramento de atenção estruturado para permitir a percepção simultânea de múltiplas regiões mascaradas, permitindo que o modelo gere descrições de regiões em paralelo tanto no nível de sequência quanto no nível de token. Esse design melhora significativamente a eficiência de inferência em comparação com abordagens existentes que processam regiões sequencialmente. Para avaliar sistematicamente a propriedade de paralelismo da capacidade de percepção visual para DLMs, construímos um novo Benchmark de Descrição Localizada Detalhada Paralela (ParaDLC-Bench), escalando o DLC-Bench para incluir múltiplas máscaras de região por imagem, permitindo a avaliação conjunta tanto da qualidade da descrição quanto da eficiência de inferência. Experimentos demonstram que o PerceptionDLM mantém desempenho competitivo na descrição de regiões, ao mesmo tempo que alcança ganhos substanciais de velocidade para tarefas de percepção de múltiplas regiões. Nossos resultados destacam o potencial de modelos de linguagem multimodais por difusão para percepção visual paralela e eficiente. Até onde sabemos, somos os primeiros a alcançar descrição e percepção paralelas de regiões, aproveitando as vantagens de modelos de linguagem por difusão. Código, modelos e conjuntos de dados são disponibilizados.
English
Multimodal large language models (MLLMs) have achieved remarkable progress in visual understanding tasks. However, most existing MLLMs rely on autoregressive generation, which limits their efficiency for perception tasks that require captioning multiple regions. In this work, we propose PerceptionDLM, a multimodal diffusion language model optimized for efficient parallel region perception. Built upon PerceptionDLM-Base, a strong foundational baseline that achieves state-of-the-art performance among open-source diffusion MLLMs, our architecture fully leverages the parallel decoding nature of DLMs. Specifically, we introduce efficient prompting and structured attention masking to enable simultaneous perception of multiple masked regions, allowing the model to generate region descriptions in parallel at both the sequence and token levels. This design significantly improves inference efficiency compared with existing approaches that process regions sequentially. To systematically evaluate the parallelism property of visual perception capability for DLMs, we construct a new Parallel Detailed Localized Captioning Benchmark (ParaDLC-Bench) by scaling the DLC-Bench to include multiple region masks per image, enabling joint evaluation of both caption quality and inference efficiency. Experiments demonstrate that PerceptionDLM maintains competitive performance in region captioning while achieving substantial speed improvements for multi-region perception tasks. Our results highlight the potential of multimodal diffusion language models for efficient, parallel visual perception. To the best of our knowledge, we are the first to achieve parallel region caption and perception by leveraging the advantages of diffusion language models. Code, models, and datasets are released.