Mascaramento Reflexivo Multi-Turn Induz Raciocínio em Modelos de Difusão de Máscara
Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models
June 15, 2026
Autores: Yanming Zhang, Yihan Bian, Jingyuan Qi, Yuguang Yao, Lifu Huang, Tianyi Zhou
cs.AI
Resumo
Embora o raciocínio sobre modelos autorregressivos (AR) seja frequentemente realizado por meio de raciocínio em cadeia de pensamento e reflexão, o refinamento de suas saídas anteriores ainda depende de geração totalmente sequencial, mesmo quando apenas edições locais são necessárias. Em contraste, o mecanismo de mascaramento em Modelos de Difusão com Máscara (MDMs) suporta naturalmente edições locais explícitas em saídas anteriores, permitindo refinamento seletivo sem descartar respostas anteriores e gerar outra do zero. Embora essa propriedade esteja mais alinhada com a forma como humanos corrigem erros por refinamento local iterativo, os MDMs existentes não suportam mascaramento e remoção de ruído em múltiplas iterações. Propomos o Mascaramento Reflexivo (RM), que extrai essa capacidade de raciocínio intrínseca dos MDMs por meio de pós-treinamento leve. O RM fornece um escalonamento nativo em tempo de teste, no qual um MDM revisita e revisa iterativamente suas saídas anteriores com base no contexto em evolução. Para explorar insights de iterações anteriores, como no raciocínio AR, introduzimos ainda a Referência de Histórico, um mecanismo livre de parâmetros que aproveita estados intermediários de remoção de ruído durante a revisão. Nossa abordagem não requer alterações arquiteturais e é facilmente aplicável a MDMs existentes. Em diversas tarefas e modalidades, incluindo geração de texto, Sudoku e edição de imagens, o Mascaramento Reflexivo supera consistentemente as abordagens baseadas em mascaramento padrão e demonstra forte generalidade, posicionando o RM como um primitivo fundamental para raciocínio em MDMs.
English
While reasoning on autoregressive (AR) models is often performed by chain-of-thought reasoning and reflection, their refinement of previous outputs still relies on fully sequential generation, even when only local edits are needed. In contrast, the masking mechanism in Mask Diffusion Models (MDMs) naturally supports explicit local edits on previous outputs, allowing selective refinement without discarding previous answers and generating another from scratch. While this property more closely aligns with how humans correct mistakes by iterative local refinement, existing MDMs do not support multi-turn masking and denoising. We propose Reflective Masking (RM), which elicits such an intrinsic reasoning capability in MDMs via lightweight post-training. RM provides a native test-time scaling, where an MDM iteratively revisits and revises its prior outputs based on evolving context. To exploit insights from previous turns like AR reasoning, we further introduce History Reference, a parameter-free mechanism that leverages intermediate denoising states during revision. Our approach requires no architectural changes and is easily applicable to existing MDMs. Across diverse tasks and modalities, including text generation, Sudoku, and image editing, Reflective Masking consistently outperforms standard masking-based baselines and demonstrates strong generality, positioning RM as a fundamental primitive for reasoning on MDMs.