ChatPaper.aiChatPaper

Injecter une conscience distributionnelle dans les MLLMs via l'apprentissage par renforcement pour la régression profonde déséquilibrée

Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression

May 11, 2026
Auteurs: Yao Du, Shanshan Song, Xiaomeng Li
cs.AI

Résumé

Les modèles de langage multimodaux de grande taille (MLLMs) rencontrent des difficultés avec la régression numérique sous des distributions cibles à longue traîne. Le fine-tuning supervisé au niveau des tokens (SFT) et les récompenses de régression ponctuelles biaisent l'apprentissage vers les régions à haute densité, entraînant un comportement de régression vers la moyenne et de mauvaises performances sur la traîne. Nous identifions le manque de supervision relationnelle inter-échantillons comme une limitation clé des paradigmes d'entraînement actuels des MLLMs. Pour y remédier, nous proposons un cadre d'apprentissage par renforcement sensible à la distribution basé sur l'Optimisation de Politique Relative par Groupes, qui introduit une supervision comparative au niveau du lot via une récompense fondée sur le Coefficient de Corrélation de Concordance afin d'aligner les distributions prédites et réelles en termes de corrélation, d'échelle et de moyenne. Ce cadre est prêt à l'emploi, ne nécessitant aucune modification architecturale. Des expériences sur une suite unifiée de benchmarks de régression à longue traîne montrent des améliorations constantes par rapport au SFT et aux méthodes de régression existantes pour MLLMs, avec des gains particulièrement marqués dans les régimes à moyenne et faible disponibilité d'exemples.
English
Multimodal large language models (MLLMs) struggle with numerical regression under long-tailed target distributions. Token-level supervised fine-tuning (SFT) and point-wise regression rewards bias learning toward high-density regions, leading to regression-to-the-mean behavior and poor tail performance. We identify the lack of cross-sample relational supervision as a key limitation of existing MLLM training paradigms. To address it, we propose a distribution-aware reinforcement learning framework based on Group Relative Policy Optimization, which introduces batch-level comparison-based supervision via the Concordance Correlation Coefficient-based reward to align predicted and ground-truth distributions in terms of correlation, scale, and mean. The framework is plug-and-play, requiring no architectural modification. Experiments on a unified suite of long-tailed regression benchmarks show consistent improvements over SFT and existing MLLM regression methods, with particularly strong gains in medium- and few-shot regimes.