Renforcement du raisonnement multimodal contre la dégradation visuelle
Reinforcing Multimodal Reasoning Against Visual Degradation
May 10, 2026
Auteurs: Rui Liu, Dian Yu, Haolin Liu, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang
cs.AI
Résumé
L'apprentissage par renforcement a considérablement amélioré les capacités de raisonnement des grands modèles de langage multimodaux (MLLM), mais les politiques qui en résultent restent fragiles face aux dégradations visuelles du monde réel telles que le flou, les artefacts de compression et les scans basse résolution. Les techniques de robustesse antérieures issues de la vision et du RL profond reposent sur l'augmentation de données statique ou la régularisation basée sur la valeur, dont aucune ne se transfère proprement au réglage fin RL sans critique des MLLM autorégressifs. Renforcer le raisonnement face à de telles corruptions est non trivial : injecter naïvement des vues dégradées pendant le déploiement induit un empoisonnement de la récompense, où les occlusions perceptuelles déclenchent des trajectoires hallucinées et déstabilisent l'optimisation. Nous proposons ROMA, un cadre de réglage fin RL qui modifie la dynamique d'optimisation pour renforcer le raisonnement face à la dégradation visuelle tout en préservant les performances sur entrées propres. Une stratégie à double passage avant utilise le teacher forcing pour évaluer les vues dégradées par rapport aux trajectoires d'images propres, évitant ainsi de nouveaux déploiements sur des entrées dégradées. Pour la cohérence distributionnelle, nous appliquons une pénalité KL de substitution au niveau des tokens contre l'augmentation dans le pire cas ; pour empêcher l'effondrement de la politique sous régularisation, une perte auxiliaire de gradient de politique ancrée aux avantages d'images propres préserve un signal de récompense fiable ; et pour éviter une invariance systématiquement incorrecte, une régularisation conditionnée par la justesse limite l'application aux trajectoires réussies. Sur Qwen3-VL 4B/8B sur sept benchmarks de raisonnement multimodal, notre méthode améliore la robustesse de +2,4% sur les corruptions vues et +2,3% sur les corruptions non vues par rapport à GRPO tout en égalant la précision sur entrées propres.
English
Reinforcement Learning has significantly advanced the reasoning capabilities of Multimodal Large Language Models (MLLMs), yet the resulting policies remain brittle against real-world visual degradations such as blur, compression artifacts, and low-resolution scans. Prior robustness techniques from vision and deep RL rely on static data augmentation or value-based regularization, neither of which transfers cleanly to critic-free RL fine-tuning of autoregressive MLLMs. Reinforcing reasoning against such corruptions is non-trivial: naively injecting degraded views during rollout induces reward poisoning, where perceptual occlusions trigger hallucinated trajectories and destabilize optimization. We propose ROMA, an RL fine-tuning framework that modifies the optimization dynamics to reinforce reasoning against visual degradation while preserving clean-input performance. A dual-forward-pass strategy uses teacher forcing to evaluate corrupted views against clean-image trajectories, avoiding new rollouts on degraded inputs. For distributional consistency, we apply a token-level surrogate KL penalty against the worst-case augmentation; to prevent policy collapse under regularization, an auxiliary policy gradient loss anchored to clean-image advantages preserves a reliable reward signal; and to avoid systematically incorrect invariance, correctness-conditioned regularization restricts enforcement to successful trajectories. On Qwen3-VL 4B/8B across seven multimodal reasoning benchmarks, our method improves robustness by +2.4% on seen and +2.3% on unseen corruptions over GRPO while matching clean accuracy.