ChatPaper.aiChatPaper

UniPath: adaptieve coördinatie van begrijpen en genereren voor uniforme multimodale redenering

UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning

May 12, 2026
Auteurs: Hayes Bai, Yinyi Luo, Wenwen Wang, Qingsong Wen, Jindong Wang
cs.AI

Samenvatting

Uniforme multimodale modellen (UMM's) streven ernaar begrip en generatie te integreren in één enkele architectuur. Het is echter nog onvoldoende onderzocht hoe deze twee capaciteiten effectief gecoördineerd kunnen worden voor effectiever en efficiënter redeneren. Bestaande coördinatiebenaderingen voeren ofwel koppeling uit tijdens de training, zonder expliciete coördinatie tijdens de inferentie, of leggen een vast coördinatiepatroon op voor alle invoer. In dit werk tonen we aan dat multimodale taken een aanzienlijke diversiteit in coördinatiepaden vertonen: verschillende invoer geeft de voorkeur aan verschillende coördinatiepaden. Dit suggereert dat het benutten van deze diversiteit essentieel is voor het verbeteren van de prestaties. We stellen UniPath voor, een raamwerk voor het adaptief modelleren en benutten van diversiteit in coördinatiepaden. In plaats van het afdwingen van één enkel coördinatiepatroon, stellen we taakoplossing voor als de selectie en uitvoering van een pad, variërend van directe beantwoording tot tekstuele inferentie, constructie van visuele gedachten en hypothesengebaseerde exploratie. We construeren rolgerichte trajecten om een padgeconditioneerde uitvoerder te trainen en introduceren een lichtgewicht plannermechanisme om invoerafhankelijke padselectie mogelijk te maken. Experimenten tonen aan dat het benutten van diversiteit in coördinatiepaden de prestaties verbetert ten opzichte van vaste coördinatiestrategieën, terwijl het interpreteerbare tussentijdse gedragingen oplevert. De code is beschikbaar op: https://github.com/AIFrontierLab/TorchUMM/tree/main/src/umm/post_training/unipath.
English
Unified multimodal models (UMMs) aim to integrate understanding and generation within a single architecture. However, it remains underexplored how to effectively coordinate these two capabilities for more effective and efficient reasoning. Existing coordination approaches either perform coupling during training, without explicit inference-time coordination, or impose a fixed coordination pattern for all inputs. In this work, we show that multimodal tasks exhibit substantial coordination-path diversity: different inputs favor different coordination paths. This suggests that exploiting such diversity is key to improving performance. We propose UniPath, a framework for adaptively modeling and exploiting coordination-path diversity. Instead of enforcing a single coordination pattern, we represent task solving as the selection and execution of a path, ranging from direct answering to textual inference, visual-thought construction, and hypothesis-based exploration. We construct role-aligned trajectories to train a path-conditioned executor and introduce a lightweight planner mechanism to enable input-dependent path selection. Experiments show that leveraging coordination-path diversity improves performance over fixed coordination strategies while providing interpretable intermediate behaviors. The code is available at:https://github.com/AIFrontierLab/TorchUMM/tree/main/src/umm/post_training/unipath.