Fusão de Duas Visualizações Baseada em Token e Adaptação de Grandes Modelos de Visão para Classificação de Câncer de Mama
Token-Based Dual-view Fusion and Adaptation of Large Vision Models for Breast Cancer Classification
July 7, 2026
Autores: Aysan Ghayouri Pirsoltan, Shima Babakordi, Mohammad Reza Mohammadi
cs.AI
Resumo
A classificação precisa do câncer de mama a partir da mamografia requer a integração eficaz de informações complementares das incidências craniocaudal (CC) e mediolateral oblíqua (MLO), que fornecem uma caracterização mais completa das anormalidades mamárias. No entanto, as abordagens existentes de aprendizado multivista geralmente dependem de agregação em nível de características ou de atenção cruzada em estágio único, o que pode embaralhar representações específicas de cada vista e compartilhadas, além de restringir a interação a profundidades limitadas da rede. Para superar essas limitações, propomos uma estrutura de aprendizado dupla-vista centrada em tokens que unifica adaptação baseada em prompts e fusão entre vistas dentro de um backbone de transformer de visão congelado. A estrutura reformula a interação entre vistas como comunicação estruturada em nível de token, onde tokens de fusão dedicados codificam explicitamente a troca bidirecional de informações entre as vistas CC e MLO por meio de atenção cruzada, servindo como transportadores intermediários das dependências entre vistas, em vez de depender da fusão direta de características. Diferentemente dos métodos convencionais que aplicam fusão em uma única camada, módulos de fusão são inseridos em múltiplas profundidades do transformer, permitindo interação progressiva e repetida ao longo da hierarquia do codificador. Os tokens de fusão são reintegrados na sequência de tokens e refinados por camadas subsequentes do transformer, facilitando a propagação hierárquica de informações complementares, preservando ao mesmo tempo a estrutura específica de cada vista. Experimentos nos conjuntos de dados VinDr-Mammo e CMMD demonstram melhorias consistentes em relação a sondagem linear, adaptação apenas com prompts e linhas de base de fusão convencionais. Na tarefa de classificação BI-RADS do VinDr-Mammo, a estrutura alcança 50,40% de F1-score e 0,8090 de AUC, incluindo uma melhoria de 0,10 na AUC em relação a uma linha de base de fusão dupla-vista no cenário binário. Estudos de ablação validam ainda mais a eficácia da fusão baseada em tokens e do design de interação em múltiplas profundidades.
English
Accurate breast cancer classification from mammography requires effective integration of complementary information from craniocaudal (CC) and mediolateral oblique (MLO) views, which provide a more complete characterization of breast abnormalities. However, existing multi-view learning approaches typically rely on feature-level aggregation or single-stage cross-attention, which can entangle view-specific and shared representations and restrict interaction to limited network depths. To address these limitations, we propose a token-centric dual-view learning framework that unifies prompt-based adaptation and cross-view fusion within a frozen vision transformer backbone. The framework reformulates inter-view interaction as structured token-level communication, where dedicated fusion tokens explicitly encode bidirectional information exchange between CC and MLO views via cross-attention, serving as intermediate carriers of cross-view dependencies rather than relying on direct feature fusion. Unlike conventional methods that apply fusion at a single layer, fusion modules are inserted at multiple transformer depths, enabling progressive and repeated interaction across the encoder hierarchy. Fusion tokens are reintegrated into the token sequence and refined by subsequent transformer layers, facilitating hierarchical propagation of complementary information while preserving view-specific structure. Experiments on VinDr-Mammo and CMMD datasets demonstrate consistent improvements over linear probing, prompt-only adaptation, and conventional fusion baselines. On the VinDr-Mammo BI-RADS classification task, the framework achieves 50.40% F1-score and 0.8090 AUC, including a 0.10 AUC improvement over a dual-view fusion baseline in the binary setting. Ablation studies further validate the effectiveness of token-based fusion and multi-depth interaction design.