ChatPaper.aiChatPaper

Transformando a Deriva em Restrição: Alinhamento Robusto do Raciocínio em Ambientes Não Estacionários

Turning Drift into Constraint: Robust Reasoning Alignment in Non-Stationary Environments

May 2, 2026
Autores: Xiaoyu Yang, En Yu, Wei Duan, Jie Lu
cs.AI

Resumo

Este artigo identifica um desafio crítico e ainda pouco explorado no alinhamento do raciocínio a partir de múltiplos modelos de linguagem multimodal de grande escala (MLLMs): em ambientes não estacionários, as diversas distribuições de raciocínio dos modelos fonte frequentemente evoluem de forma imprevisível, transmitindo vieses sistemáticos e deriva (*drift*) para o modelo alvo. Para abordar esta questão, formulamos o alinhamento do raciocínio multi-fonte como um problema de satisfação de restrições sob a teoria do conceito de deriva (*concept drift*). Propomos a Otimização Autónoma de Preferências (APO), uma estrutura inovadora que trata as divergências inter-modelos não como ruído, mas como restrições negativas dinâmicas. A APO opera através de um protocolo de duas etapas: primeiro, um *bootstrapping* supervisionado projeta o modelo alvo para a união de capacidades dos modelos fonte; segundo, uma otimização consciente das restrições sintetiza uma variedade de consenso consistente, suprimindo explicitamente trajetórias de deriva através de um objetivo multi-negativo de Plackett-Luce. Experimentos extensivos na interpretação de radiografias torácicas demonstram que o nosso modelo de 7B atinge uma robustez superior, superando até mesmo modelos fonte proprietários em precisão média. Adicionalmente, disponibilizamos o CXR-MAX, um *benchmark* de larga escala que compreende 170.982 trajetórias de raciocínio de sete MLLMs de grande escala, para facilitar a investigação sobre o alinhamento do raciocínio sob deriva. O código e os dados estão disponíveis em: https://github.com/XiaoyuYoung/APO.
English
This paper identifies a critical yet underexplored challenge in reasoning alignment from multiple multi-modal large language models (MLLMs): In non-stationary environments, the diverse reasoning distributions of source models often evolve unpredictably, transmitting systematic biases and drift to the target model. To address this, we formulate multi-source reasoning alignment as a constraint satisfaction problem under concept drift theory. We propose Autonomous Preference Optimization (APO), a novel framework that treats inter-model divergences not as noise, but as dynamic negative constraints. APO operates via a two-stage protocol: first, supervised bootstrapping projects the target model into the capability union of source models; second, constraint-aware optimization synthesizes a consistent consensus manifold by explicitly suppressing drifting trajectories via a multi-negative Plackett-Luce objective. Extensive experiments on chest X-ray interpretation demonstrate that our 7B model achieves superior robustness, outperforming even proprietary source models in average accuracy. Furthermore, we release CXR-MAX, a large-scale benchmark comprising 170,982 reasoning trajectories from seven large-scale MLLMs to facilitate research on reasoning alignment under drift. Code and data are available at: https://github.com/XiaoyuYoung/APO.