BalCapRL: Um Framework Balanceado para Legendagem de Imagens com MLLM Baseada em RL
BalCapRL: A Balanced Framework for RL-Based MLLM Image Captioning
May 8, 2026
Autores: Shaokai Ye, Vasileios Saveris, Yihao Qian, Jiaming Hu, Elmira Amirloo, Peter Grasch
cs.AI
Resumo
A geração de legendas de imagens é uma das tarefas mais fundamentais em visão computacional. Devido à sua natureza aberta, tem recebido atenção significativa na era dos modelos multimodais de grande linguagem (MLLMs). Na busca por legendas cada vez mais detalhadas e precisas, trabalhos recentes têm recorrido cada vez mais ao aprendizado por reforço (RL). No entanto, métodos e métricas de avaliação existentes de RL para legendagem frequentemente enfatizam uma noção restrita de qualidade da legenda, induzindo compromissos entre dimensões centrais da legendagem. Por exemplo, objetivos orientados à utilidade podem incentivar legendas ruidosas, alucinadas ou excessivamente longas que melhoram a resposta a perguntas downstream, mas prejudicam a fluência, enquanto objetivos no estilo arena podem favorecer descrições fluidas, porém genéricas, com utilidade limitada. Para lidar com isso, propomos uma estrutura de RL mais equilibrada que otimiza conjuntamente correção consciente da utilidade, cobertura de referência e qualidade linguística. Para otimizar efetivamente a formulação de recompensa multiobjetivo contínua resultante, aplicamos normalização desacoplada de recompensa no estilo GDPO a recompensas de legendagem de valor contínuo e mostramos que ela melhora o desempenho em relação ao GRPO padrão. Além disso, introduzimos mascaramento de recompensa condicionado ao comprimento, resultando em uma penalidade de comprimento mais adequada para legendagem. Nos modelos base LLaVA-1.5-7B e Qwen2.5-VL 3B e 7B, nosso método melhora consistentemente a qualidade das legendas, com ganhos máximos de +13,6 DCScore, +9,0 CaptionQA e +29,0 CapArena em diferentes modelos.
English
Image captioning is one of the most fundamental tasks in computer vision. Owing to its open-ended nature, it has received significant attention in the era of multimodal large language models (MLLMs). In pursuit of ever more detailed and accurate captions, recent work has increasingly turned to reinforcement learning (RL). However, existing captioning-RL methods and evaluation metrics often emphasize a narrow notion of caption quality, inducing trade-offs across core dimensions of captioning. For example, utility-oriented objectives can encourage noisy, hallucinated, or overlong captions that improve downstream question answering while harming fluency, whereas arena-style objectives can favor fluent but generic descriptions with limited usefulness. To address this, we propose a more balanced RL framework that jointly optimizes utility-aware correctness, reference coverage, and linguistic quality. In order to effectively optimize the resulting continuous multi-objective reward formulation, we apply GDPO-style reward-decoupled normalization to continuous-valued captioning rewards and show that it improves performance over vanilla GRPO. Additionally, we introduce length-conditional reward masking, yielding a more suitable length penalty for captioning. Across LLaVA-1.5-7B and Qwen2.5-VL 3B and 7B base models, our method consistently improves caption quality, with peak gains of +13.6 DCScore, +9.0 CaptionQA, and +29.0 CapArena across different models.