Compréhension et génération concurrentes d’images : processus de saut de Markov couplés auto-correctifs
Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes
July 14, 2026
Auteurs: Minh-Quan Le, Armand Comas, Alexandros Lattas, Stylianos Moschoglou, Pedro Vélez, Amit Raj, Aaron Germuth, Thabo Beeler, Dimitris Samaras, Di Qiu
cs.AI
Résumé
La cognition humaine ne sépare pas la compréhension et la génération. Un enseignant au tableau parle et dessine simultanément, chaque modalité remodelant l'autre. Dans cet article, nous transposons cette boucle couplée aux systèmes artificiels. Les Modèles de Diffusion Masqués (MDM) sont idéalement adaptés à cette tâche, pourtant les échantillonneurs existants soit décodent le texte et l'image de manière entrelacée, soit les mettent à jour indépendamment dans des branches parallèles qui partagent uniquement l'historique de l'étape précédente, mais pas les dernières décisions de l'autre modalité au sein de la même étape ; combiné à l'incapacité des MDM à remasquer, les contradictions inter-modales ne sont ni détectées ni corrigées. Nous introduisons les Processus de Sauts de Markov Couplés Auto-Correcteurs (SC-CMJP), un cadre dans lequel les taux de transition d'une modalité sont des fonctionnelles du score de confiance de l'autre modalité, pondéré par l'attention inter-modale. De plus, un saut de remasquage annule les engagements dès que les preuves inter-modales s'y opposent. En conjonction avec SC-CMJP, nous introduisons CO₂Jump (Saut Couplé Auto-Correcteur), un nouvel échantillonneur en un seul passage, sans entraînement, pour la génération multimodale conjointe. À des fins d'entraînement et d'évaluation, nous avons créé et publierons trois grands corpus de génération multimodale conjointe : JEdit-1M, JMaze-200K, JNono-200K, avec des références intra- et hors-distribution correspondantes. CO₂Jump atteint les meilleures performances conjointes en compréhension et édition d'images ainsi qu'en raisonnement visuel (résolution de labyrinthes et de nonogrammes). Les performances de l'échantillonneur augmentent de manière monotone avec le nombre d'étapes de débruitage, preuve que les bénéfices du couplage inter-modal s'accumulent le long de la trajectoire. Page du projet : https://coupled-jump.github.io
English
Human cognition does not separate understanding and generation. A teacher at a whiteboard speaks and draws together, each modality reshapes the other. In this paper, we bring this coupled loop to artificial systems. Masked Diffusion Models (MDMs) are ideally suited to this task, yet existing samplers either decode text and image interleavedly or independently update them in parallel branches that share only previous-step history, but not the other modality's latest decisions within the same step; combined with MDMs' inability to remask, cross-modal contradictions are neither detected nor repaired. We introduce Self-Correcting Coupled Markov Jump Processes (SC-CMJP), a framework in which one modality's transition rates are functionals of the other modality's confidence score, as weighted by cross-modal attention. Furthermore, a remasking jump retracts commitments the moment cross-modal evidence turns against them. In conjunction with SC-CMJP, we introduce CO_2Jump (Self-text{CO}rrecting text{CO}upled text{Jump}), a novel training-free single-pass sampler for joint multimodal geneneration. For training and evaluation purposes, we have created and will release three large-scale joint multimodal generation corpora: JEdit-1M, JMaze-200K, JNono-200K, with matching in- and out-of-distribution benchmarks. CO_2Jump achieves best joint performance for image understanding and editing as well as visual reasoning (maze and nonogram solving). The performance of the sampler scales monotonically with the number of denoising steps, evidence that the benefits of cross-modal coupling compound across the trajectory. Project page: https://coupled-jump.github.io