ChatPaper.aiChatPaper

Совместное понимание и генерация изображений: самокорректирующиеся связанные марковские скачкообразные процессы

Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes

July 14, 2026
Авторы: Minh-Quan Le, Armand Comas, Alexandros Lattas, Stylianos Moschoglou, Pedro Vélez, Amit Raj, Aaron Germuth, Thabo Beeler, Dimitris Samaras, Di Qiu
cs.AI

Аннотация

Человеческое познание не разделяет понимание и генерацию. Учитель у доски одновременно говорит и рисует, каждая модальность изменяет другую. В данной работе мы переносим этот взаимосвязанный цикл на искусственные системы. Маскированные диффузионные модели (MDMs) идеально подходят для этой задачи, однако существующие сэмплеры либо декодируют текст и изображение чередующимся образом, либо независимо обновляют их в параллельных ветвях, совместно использующих только историю предыдущего шага, но не последние решения другой модальности в пределах одного шага; в сочетании с неспособностью MDMs к перемаскированию, кросс-модальные противоречия не выявляются и не исправляются. Мы представляем самокорректирующиеся связанные марковские прыжковые процессы (SC-CMJP) — фреймворк, в котором интенсивности переходов одной модальности являются функционалами оценки уверенности другой модальности, взвешенной с помощью кросс-модального внимания. Кроме того, прыжок с перемаскированием отзывает принятые решения в тот момент, когда кросс-модальные данные свидетельствуют против них. В сочетании с SC-CMJP мы представляем CO₂Jump (Self-Correcting Coupled Jump) — новый сэмплер без обучения с однопроходной выборкой для совместной мультимодальной генерации. Для целей обучения и оценки мы создали и опубликуем три крупномасштабных корпуса совместной мультимодальной генерации: JEdit-1M, JMaze-200K, JNono-200K с соответствующими бенчмарками в распределении и вне его. CO₂Jump достигает наилучшей совместной производительности для понимания и редактирования изображений, а также визуального рассуждения (решения лабиринтов и нонограмм). Эффективность сэмплера монотонно возрастает с увеличением числа шагов шумоподавления, что служит свидетельством накопления преимуществ кросс-модальной связи на протяжении всей траектории. Страница проекта: https://coupled-jump.github.io
English
Human cognition does not separate understanding and generation. A teacher at a whiteboard speaks and draws together, each modality reshapes the other. In this paper, we bring this coupled loop to artificial systems. Masked Diffusion Models (MDMs) are ideally suited to this task, yet existing samplers either decode text and image interleavedly or independently update them in parallel branches that share only previous-step history, but not the other modality's latest decisions within the same step; combined with MDMs' inability to remask, cross-modal contradictions are neither detected nor repaired. We introduce Self-Correcting Coupled Markov Jump Processes (SC-CMJP), a framework in which one modality's transition rates are functionals of the other modality's confidence score, as weighted by cross-modal attention. Furthermore, a remasking jump retracts commitments the moment cross-modal evidence turns against them. In conjunction with SC-CMJP, we introduce CO_2Jump (Self-text{CO}rrecting text{CO}upled text{Jump}), a novel training-free single-pass sampler for joint multimodal geneneration. For training and evaluation purposes, we have created and will release three large-scale joint multimodal generation corpora: JEdit-1M, JMaze-200K, JNono-200K, with matching in- and out-of-distribution benchmarks. CO_2Jump achieves best joint performance for image understanding and editing as well as visual reasoning (maze and nonogram solving). The performance of the sampler scales monotonically with the number of denoising steps, evidence that the benefits of cross-modal coupling compound across the trajectory. Project page: https://coupled-jump.github.io