ChatPaper.aiChatPaper

SeePhys Pro: Diagnose van modaliteitsoverdracht en blindtrainingseffecten in multimodale RLVR voor natuurkundig redeneren

SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning

May 10, 2026
Auteurs: Kun Xiang, Terry Jingchen Zhang, Zirong Liu, Bokai Zhou, Yueling Tang, Junjie Yu, Jiacong Lu, Shangrui Huang, Heng Li, Likui Zhang, Kunkun Liu, Changzheng Zhang, Yangle Fang, Boqiang Guo, Hui-Ling Zhen, Dandan Tu, Yinya Huang, Xiaodan Liang
cs.AI

Samenvatting

Wij introduceren SeePhys Pro, een fijnmazige benchmark voor modaliteitsoverdracht die onderzoekt of modellen dezelfde redeneercapaciteit behouden wanneer kritieke informatie geleidelijk van tekst naar beeld wordt overgebracht. In tegenstelling tot standaard visueel-essentiële benchmarks die één enkele invoervorm evalueren, bevat SeePhys Pro vier semantisch uitgelijnde varianten voor elk probleem met een steeds groter wordend aantal visuele elementen. Onze evaluatie toont aan dat huidige frontiermodellen verre van representatie-invariante redeneerders zijn: de prestaties verslechteren gemiddeld naarmate informatie van taal naar diagrammen verschuift, waarbij visuele variabele verankering het meest kritieke knelpunt vormt. Gemotiveerd door deze inferentietijd-fragiliteit hebben we verder grote trainingscorpora ontwikkeld voor multimodale RLVR en gebruiken we blinde training als diagnostische controle, waarbij we vaststellen dat RL met alle trainingsafbeeldingen gema skeerd nog steeds de prestaties op ongemaskeerde validatiesets kan verbeteren. Om dit effect te analyseren suggereren controles op tekstverwijdering, afbeeldingsmaskeringsgraad en formaatverzadiging dat dergelijke winst kan voortkomen uit resterende tekstuele en distributionele aanwijzingen in plaats van geldig visueel bewijs. Onze resultaten benadrukken de noodzaak om multimodaal redeneren niet alleen te beoordelen op de nauwkeurigheid van het uiteindelijke antwoord, maar ook op robuustheid onder modaliteitsoverdracht en met diagnostiek die test of verbeteringen afhankelijk zijn van taak-kritisch visueel bewijs.
English
We introduce SeePhys Pro, a fine-grained modality transfer benchmark that studies whether models preserve the same reasoning capability when critical information is progressively transferred from text to image. Unlike standard vision-essential benchmarks that evaluate a single input form, SeePhys Pro features four semantically aligned variants for each problem with progressively increasing visual elements. Our evaluation shows that current frontier models are far from representation-invariant reasoners: performance degrades on average as information moves from language to diagrams, with visual variable grounding as the most critical bottleneck. Motivated by this inference-time fragility, we further develop large training corpora for multimodal RLVR and use blind training as a diagnostic control, finding that RL with all training images masked can still improve performance on unmasked validation sets. To analyze this effect, text-deletion, image-mask-rate, and format-saturation controls suggest that such gains can arise from residual textual and distributional cues rather than valid visual evidence. Our results highlight the need to evaluate multimodal reasoning not only by final-answer accuracy, but also by robustness under modality transfer and by diagnostics that test whether improvements rely on task-critical visual evidence.