Versterken van multimodale redenering tegen visuele degradatie
Reinforcing Multimodal Reasoning Against Visual Degradation
May 10, 2026
Auteurs: Rui Liu, Dian Yu, Haolin Liu, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang
cs.AI
Samenvatting
Reinforcement Learning heeft de redeneervaardigheden van Multimodale Grote Taalmodellen (MLLMs) aanzienlijk verbeterd, maar de resulterende beleidsvormen blijven kwetsbaar voor visuele degradaties in de echte wereld, zoals vervaging, compressieartefacten en scans met een lage resolutie. Eerdere robuustheidstechnieken uit de visuele en diepe RL maken gebruik van statische data-augmentatie of waardegebaseerde regularisatie, die geen van beide soepel overdraagbaar zijn naar criticus-vrije RL-fine-tuning van autoregressieve MLLMs. Het versterken van redeneren tegen dergelijke corrupties is niet triviaal: het naïef injecteren van gedegradeerde aanzichten tijdens de uitrol leidt tot beloningsvergiftiging, waarbij perceptuele occlusies hallucinerende trajecten opwekken en de optimalisatie destabiliseren. Wij stellen ROMA voor, een RL-fine-tuningraamwerk dat de optimalisatiedynamiek aanpast om redeneren tegen visuele degradatie te versterken, met behoud van prestaties op schone inputs. Een dubbele voorwaartse-passtrategie gebruikt teacher forcing om gecorrumpeerde aanzichten te evalueren ten opzichte van schone-beeldtrajecten, waardoor nieuwe uitrollen op gedegradeerde inputs worden vermeden. Voor distributionele consistentie passen we een token-niveau surrogaat KL-straf toe tegen de slechtste augmentatie; om beleidsinstorting onder regularisatie te voorkomen, verankert een hulpbeleidsgradiëntverlies, gebaseerd op voordelen van schone beelden, een betrouwbaar beloningssignaal; en om systematisch onjuiste invariantie te vermijden, beperkt correctheid-geconditioneerde regularisatie de handhaving tot succesvolle trajecten. Op Qwen3-VL 4B/8B over zeven multimodale redeneerbenchmarks verbetert onze methode de robuustheid met +2,4% op geziene en +2,3% op ongeziene corrupties ten opzichte van GRPO, terwijl de schone nauwkeurigheid behouden blijft.
English
Reinforcement Learning has significantly advanced the reasoning capabilities of Multimodal Large Language Models (MLLMs), yet the resulting policies remain brittle against real-world visual degradations such as blur, compression artifacts, and low-resolution scans. Prior robustness techniques from vision and deep RL rely on static data augmentation or value-based regularization, neither of which transfers cleanly to critic-free RL fine-tuning of autoregressive MLLMs. Reinforcing reasoning against such corruptions is non-trivial: naively injecting degraded views during rollout induces reward poisoning, where perceptual occlusions trigger hallucinated trajectories and destabilize optimization. We propose ROMA, an RL fine-tuning framework that modifies the optimization dynamics to reinforce reasoning against visual degradation while preserving clean-input performance. A dual-forward-pass strategy uses teacher forcing to evaluate corrupted views against clean-image trajectories, avoiding new rollouts on degraded inputs. For distributional consistency, we apply a token-level surrogate KL penalty against the worst-case augmentation; to prevent policy collapse under regularization, an auxiliary policy gradient loss anchored to clean-image advantages preserves a reliable reward signal; and to avoid systematically incorrect invariance, correctness-conditioned regularization restricts enforcement to successful trajectories. On Qwen3-VL 4B/8B across seven multimodal reasoning benchmarks, our method improves robustness by +2.4% on seen and +2.3% on unseen corruptions over GRPO while matching clean accuracy.