ChatPaper.aiChatPaper

SeePhys Pro: Diagnosticando Transferência de Modalidade e Efeitos de Treinamento Cego em RLVR Multimodal para Raciocínio Físico

SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning

May 10, 2026
Autores: Kun Xiang, Terry Jingchen Zhang, Zirong Liu, Bokai Zhou, Yueling Tang, Junjie Yu, Jiacong Lu, Shangrui Huang, Heng Li, Likui Zhang, Kunkun Liu, Changzheng Zhang, Yangle Fang, Boqiang Guo, Hui-Ling Zhen, Dandan Tu, Yinya Huang, Xiaodan Liang
cs.AI

Resumo

Apresentamos o SeePhys Pro, um benchmark de transferência de modalidade de granularidade fina que investiga se os modelos preservam a mesma capacidade de raciocínio quando informações críticas são progressivamente transferidas do texto para a imagem. Diferentemente dos benchmarks padrão centrados em visão que avaliam uma única forma de entrada, o SeePhys Pro apresenta quatro variantes semanticamente alinhadas para cada problema, com elementos visuais progressivamente crescentes. Nossa avaliação mostra que os modelos de fronteira atuais estão longe de serem raciocinadores invariantes à representação: o desempenho médio diminui à medida que a informação se desloca da linguagem para diagramas, sendo a ancoragem de variáveis visuais o gargalo mais crítico. Motivados por essa fragilidade em tempo de inferência, desenvolvemos ainda grandes corpora de treinamento para RLVR multimodal e usamos treinamento cego como controle de diagnóstico, constatando que o RL com todas as imagens de treinamento mascaradas ainda pode melhorar o desempenho em conjuntos de validação sem máscara. Para analisar esse efeito, controles de exclusão de texto, taxa de máscara de imagem e saturação de formato sugerem que tais ganhos podem surgir de pistas textuais e distribucionais residuais, em vez de evidências visuais válidas. Nossos resultados destacam a necessidade de avaliar o raciocínio multimodal não apenas pela precisão da resposta final, mas também pela robustez sob transferência de modalidade e por diagnósticos que testem se as melhorias dependem de evidências visuais críticas para a tarefa.
English
We introduce SeePhys Pro, a fine-grained modality transfer benchmark that studies whether models preserve the same reasoning capability when critical information is progressively transferred from text to image. Unlike standard vision-essential benchmarks that evaluate a single input form, SeePhys Pro features four semantically aligned variants for each problem with progressively increasing visual elements. Our evaluation shows that current frontier models are far from representation-invariant reasoners: performance degrades on average as information moves from language to diagrams, with visual variable grounding as the most critical bottleneck. Motivated by this inference-time fragility, we further develop large training corpora for multimodal RLVR and use blind training as a diagnostic control, finding that RL with all training images masked can still improve performance on unmasked validation sets. To analyze this effect, text-deletion, image-mask-rate, and format-saturation controls suggest that such gains can arise from residual textual and distributional cues rather than valid visual evidence. Our results highlight the need to evaluate multimodal reasoning not only by final-answer accuracy, but also by robustness under modality transfer and by diagnostics that test whether improvements rely on task-critical visual evidence.