ChatPaper.aiChatPaper

Gleichzeitiges Bildverstehen und Bildgenerierung: Selbstkorrigierende gekoppelte Markov-Sprungprozesse

Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes

July 14, 2026
Autoren: Minh-Quan Le, Armand Comas, Alexandros Lattas, Stylianos Moschoglou, Pedro Vélez, Amit Raj, Aaron Germuth, Thabo Beeler, Dimitris Samaras, Di Qiu
cs.AI

Zusammenfassung

Die menschliche Kognition trennt nicht zwischen Verstehen und Generieren. Ein Lehrer spricht und zeichnet gleichzeitig an einer Tafel – jede Modalität formt die andere neu. In dieser Arbeit übertragen wir diese gekoppelte Rückkopplungsschleife auf künstliche Systeme. Maskierte Diffusionsmodelle (MDMs) sind für diese Aufgabe ideal geeignet, jedoch dekodieren bestehende Sampler entweder Text und Bild verschränkt oder aktualisieren sie unabhängig voneinander in parallelen Zweigen, die nur die Historie des vorherigen Schritts teilen, nicht jedoch die aktuellsten Entscheidungen der anderen Modalität innerhalb desselben Schritts; in Kombination mit der Unfähigkeit von MDMs, eine erneute Maskierung durchzuführen, werden kreuzmodale Widersprüche weder erkannt noch behoben. Wir führen selbstkorrigierende gekoppelte Markov-Sprungprozesse (SC-CMJP) ein, ein Framework, bei dem die Übergangsraten einer Modalität Funktionale des Konfidenzwerts der anderen Modalität sind, gewichtet durch kreuzmodule Aufmerksamkeit. Darüber hinaus macht ein erneuter Maskierungssprung Zusagen rückgängig, sobald kreuzmodule Evidenz dagegenspricht. In Verbindung mit SC-CMJP stellen wir CO₂Jump (Self-Text{CO}rrecting text{CO}upled text{Jump}) vor, einen neuartigen, trainingsfreien Single-Pass-Sampler für die gemeinsame multimodale Generierung. Für Trainings- und Evaluierungszwecke haben wir drei groß angelegte multimodale gemeinsame Generierungskorpora erstellt und werden sie veröffentlichen: JEdit-1M, JMaze-200K, JNono-200K, mit passenden In- und Out-of-Distribution-Benchmarks. CO₂Jump erzielt die beste gemeinsame Leistung bei Bildverständnis und -bearbeitung sowie visuellem Denken (Labyrinth- und Nonogramm-Lösung). Die Leistung des Samplers steigt monoton mit der Anzahl der Denoising-Schritte, ein Beleg dafür, dass die Vorteile der kreuzmodalen Kopplung entlang der Trajektorie zunehmen. Projektseite: https://coupled-jump.github.io
English
Human cognition does not separate understanding and generation. A teacher at a whiteboard speaks and draws together, each modality reshapes the other. In this paper, we bring this coupled loop to artificial systems. Masked Diffusion Models (MDMs) are ideally suited to this task, yet existing samplers either decode text and image interleavedly or independently update them in parallel branches that share only previous-step history, but not the other modality's latest decisions within the same step; combined with MDMs' inability to remask, cross-modal contradictions are neither detected nor repaired. We introduce Self-Correcting Coupled Markov Jump Processes (SC-CMJP), a framework in which one modality's transition rates are functionals of the other modality's confidence score, as weighted by cross-modal attention. Furthermore, a remasking jump retracts commitments the moment cross-modal evidence turns against them. In conjunction with SC-CMJP, we introduce CO_2Jump (Self-text{CO}rrecting text{CO}upled text{Jump}), a novel training-free single-pass sampler for joint multimodal geneneration. For training and evaluation purposes, we have created and will release three large-scale joint multimodal generation corpora: JEdit-1M, JMaze-200K, JNono-200K, with matching in- and out-of-distribution benchmarks. CO_2Jump achieves best joint performance for image understanding and editing as well as visual reasoning (maze and nonogram solving). The performance of the sampler scales monotonically with the number of denoising steps, evidence that the benefits of cross-modal coupling compound across the trajectory. Project page: https://coupled-jump.github.io