ChatPaper.aiChatPaper

UniPath: Coordenação Adaptativa de Compreensão e Geração para Raciocínio Multimodal Unificado

UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning

May 12, 2026
Autores: Hayes Bai, Yinyi Luo, Wenwen Wang, Qingsong Wen, Jindong Wang
cs.AI

Resumo

Modelos multimodais unificados (MMUs) têm como objetivo integrar compreensão e geração em uma única arquitetura. No entanto, ainda não foi suficientemente explorado como coordenar efetivamente essas duas capacidades para um raciocínio mais eficiente e eficaz. Abordagens de coordenação existentes ou realizam o acoplamento durante o treinamento, sem coordenação explícita durante a inferência, ou impõem um padrão de coordenação fixo para todas as entradas. Neste trabalho, mostramos que tarefas multimodais apresentam uma diversidade substancial de caminhos de coordenação: entradas diferentes favorecem caminhos de coordenação distintos. Isso sugere que explorar tal diversidade é chave para melhorar o desempenho. Propomos o UniPath, uma estrutura para modelar e explorar adaptativamente a diversidade de caminhos de coordenação. Em vez de impor um único padrão de coordenação, representamos a resolução de tarefas como a seleção e execução de um caminho, que vai desde a resposta direta até a inferência textual, construção de pensamento visual e exploração baseada em hipóteses. Construímos trajetórias alinhadas por função para treinar um executor condicionado ao caminho e introduzimos um mecanismo planejador leve para permitir a seleção de caminho dependente da entrada. Experimentos mostram que aproveitar a diversidade de caminhos de coordenação melhora o desempenho em relação a estratégias de coordenação fixas, ao mesmo tempo que fornece comportamentos intermediários interpretáveis. O código está disponível em: https://github.com/AIFrontierLab/TorchUMM/tree/main/src/umm/post_training/unipath.
English
Unified multimodal models (UMMs) aim to integrate understanding and generation within a single architecture. However, it remains underexplored how to effectively coordinate these two capabilities for more effective and efficient reasoning. Existing coordination approaches either perform coupling during training, without explicit inference-time coordination, or impose a fixed coordination pattern for all inputs. In this work, we show that multimodal tasks exhibit substantial coordination-path diversity: different inputs favor different coordination paths. This suggests that exploiting such diversity is key to improving performance. We propose UniPath, a framework for adaptively modeling and exploiting coordination-path diversity. Instead of enforcing a single coordination pattern, we represent task solving as the selection and execution of a path, ranging from direct answering to textual inference, visual-thought construction, and hypothesis-based exploration. We construct role-aligned trajectories to train a path-conditioned executor and introduce a lightweight planner mechanism to enable input-dependent path selection. Experiments show that leveraging coordination-path diversity improves performance over fixed coordination strategies while providing interpretable intermediate behaviors. The code is available at:https://github.com/AIFrontierLab/TorchUMM/tree/main/src/umm/post_training/unipath.