Het injecteren van distributiebewustzijn in MLLMs via reinforcement learning voor diepe ongebalanceerde regressie
Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression
May 11, 2026
Auteurs: Yao Du, Shanshan Song, Xiaomeng Li
cs.AI
Samenvatting
Multimodale grote taalmodellen (MLLM's) ondervinden problemen met numerieke regressie onder langstaartige doelverdelingen. Token-niveau gesuperviseerde fine-tuning (SFT) en puntsgewijze regressiebeloningen zorgen voor een bias in het leren naar gebieden met een hoge dichtheid, wat leidt tot regressie-naar-het-gemiddelde gedrag en slechte prestaties op de staart. Wij identificeren het gebrek aan cross-sample relationele supervisie als een belangrijke beperking van bestaande MLLM-trainingsparadigma's. Om dit aan te pakken, stellen we een distributiebewust versterkend leerkader voor, gebaseerd op Group Relative Policy Optimization, dat batch-niveau vergelijkingsgebaseerde supervisie introduceert via een beloning op basis van de Concordantiecorrelatiecoëfficiënt om voorspelde en werkelijke verdelingen op elkaar af te stemmen wat betreft correlatie, schaal en gemiddelde. Het kader is plug-and-play en vereist geen architectuurwijzigingen. Experimenten op een uniforme reeks langstaartige regressiebenchmarks tonen consistente verbeteringen aan ten opzichte van SFT en bestaande MLLM-regressiemethoden, met bijzonder sterke winst in medium-shot en few-shot regimes.
English
Multimodal large language models (MLLMs) struggle with numerical regression under long-tailed target distributions. Token-level supervised fine-tuning (SFT) and point-wise regression rewards bias learning toward high-density regions, leading to regression-to-the-mean behavior and poor tail performance. We identify the lack of cross-sample relational supervision as a key limitation of existing MLLM training paradigms. To address it, we propose a distribution-aware reinforcement learning framework based on Group Relative Policy Optimization, which introduces batch-level comparison-based supervision via the Concordance Correlation Coefficient-based reward to align predicted and ground-truth distributions in terms of correlation, scale, and mean. The framework is plug-and-play, requiring no architectural modification. Experiments on a unified suite of long-tailed regression benchmarks show consistent improvements over SFT and existing MLLM regression methods, with particularly strong gains in medium- and few-shot regimes.