Injetando Consciência Distribucional em MLLMs via Aprendizado por Reforço para Regressão Desbalanceada Profunda
Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression
May 11, 2026
Autores: Yao Du, Shanshan Song, Xiaomeng Li
cs.AI
Resumo
Modelos de linguagem grandes multimodais (MLLMs) enfrentam dificuldades com regressão numérica sob distribuições-alvo de cauda longa. O ajuste fino supervisionado em nível de token (SFT) e as recompensas de regressão pontual tendem a privilegiar o aprendizado em regiões de alta densidade, resultando em um comportamento de regressão à média e desempenho inferior nas caudas. Identificamos a ausência de supervisão relacional entre amostras como uma limitação fundamental dos paradigmas de treinamento de MLLMs existentes. Para solucioná-la, propomos um framework de aprendizado por reforço ciente da distribuição baseado na Otimização de Política Relativa em Grupo, que introduz supervisão comparativa em nível de lote por meio de uma recompensa baseada no Coeficiente de Correlação de Concordância, a fim de alinhar as distribuições previstas e reais em termos de correlação, escala e média. O framework é plug-and-play, não exigindo modificações arquitetônicas. Experimentos em uma suíte unificada de benchmarks de regressão com cauda longa demonstram melhorias consistentes em relação ao SFT e a métodos de regressão para MLLMs existentes, com ganhos particularmente expressivos nos regimes de poucas e médias amostras.
English
Multimodal large language models (MLLMs) struggle with numerical regression under long-tailed target distributions. Token-level supervised fine-tuning (SFT) and point-wise regression rewards bias learning toward high-density regions, leading to regression-to-the-mean behavior and poor tail performance. We identify the lack of cross-sample relational supervision as a key limitation of existing MLLM training paradigms. To address it, we propose a distribution-aware reinforcement learning framework based on Group Relative Policy Optimization, which introduces batch-level comparison-based supervision via the Concordance Correlation Coefficient-based reward to align predicted and ground-truth distributions in terms of correlation, scale, and mean. The framework is plug-and-play, requiring no architectural modification. Experiments on a unified suite of long-tailed regression benchmarks show consistent improvements over SFT and existing MLLM regression methods, with particularly strong gains in medium- and few-shot regimes.