ChatPaper.aiChatPaper

Comprensión y Generación Concurrentes de Imágenes: Procesos de Markov de Saltos Autocorrectivos Acoplados

Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes

July 14, 2026
Autores: Minh-Quan Le, Armand Comas, Alexandros Lattas, Stylianos Moschoglou, Pedro Vélez, Amit Raj, Aaron Germuth, Thabo Beeler, Dimitris Samaras, Di Qiu
cs.AI

Resumen

La cognición humana no separa la comprensión de la generación. Un docente frente a una pizarra habla y dibuja simultáneamente, y cada modalidad remodela a la otra. En este artículo, trasladamos este bucle acoplado a sistemas artificiales. Los Modelos de Difusión Enmascarados (MDMs) son ideales para esta tarea, pero los muestreadores existentes decodifican texto e imagen de manera intercalada o los actualizan de forma independiente en ramas paralelas que comparten solo el historial del paso anterior, pero no las últimas decisiones de la otra modalidad dentro del mismo paso; combinado con la incapacidad de los MDMs para desenmascarar, las contradicciones entre modalidades no se detectan ni se corrigen. Presentamos los Procesos de Salto de Markov Acoplados y Autocorrectivos (SC-CMJP), un marco en el que las tasas de transición de una modalidad son funcionales de la puntuación de confianza de la otra modalidad, ponderada por la atención entre modalidades. Además, un salto de desenmascaramiento revoca compromisos en el momento en que la evidencia entre modalidades se vuelve en su contra. En conjunto con SC-CMJP, introducimos CO₂Jump (Salto Acoplado Autocorrectivo), un novedoso muestreador de una sola pasada y sin entrenamiento para la generación conjunta multimodal. Con fines de entrenamiento y evaluación, hemos creado y publicaremos tres corpus a gran escala de generación conjunta multimodal: JEdit-1M, JMaze-200K y JNono-200K, con puntos de referencia coincidentes dentro y fuera de la distribución. CO₂Jump logra el mejor rendimiento conjunto para la comprensión y edición de imágenes, así como para el razonamiento visual (resolución de laberintos y nonogramas). El rendimiento del muestreador escala monótonamente con el número de pasos de eliminación de ruido, evidencia de que los beneficios del acoplamiento entre modalidades se acumulan a lo largo de la trayectoria. Página del proyecto: https://coupled-jump.github.io
English
Human cognition does not separate understanding and generation. A teacher at a whiteboard speaks and draws together, each modality reshapes the other. In this paper, we bring this coupled loop to artificial systems. Masked Diffusion Models (MDMs) are ideally suited to this task, yet existing samplers either decode text and image interleavedly or independently update them in parallel branches that share only previous-step history, but not the other modality's latest decisions within the same step; combined with MDMs' inability to remask, cross-modal contradictions are neither detected nor repaired. We introduce Self-Correcting Coupled Markov Jump Processes (SC-CMJP), a framework in which one modality's transition rates are functionals of the other modality's confidence score, as weighted by cross-modal attention. Furthermore, a remasking jump retracts commitments the moment cross-modal evidence turns against them. In conjunction with SC-CMJP, we introduce CO_2Jump (Self-text{CO}rrecting text{CO}upled text{Jump}), a novel training-free single-pass sampler for joint multimodal geneneration. For training and evaluation purposes, we have created and will release three large-scale joint multimodal generation corpora: JEdit-1M, JMaze-200K, JNono-200K, with matching in- and out-of-distribution benchmarks. CO_2Jump achieves best joint performance for image understanding and editing as well as visual reasoning (maze and nonogram solving). The performance of the sampler scales monotonically with the number of denoising steps, evidence that the benefits of cross-modal coupling compound across the trajectory. Project page: https://coupled-jump.github.io