Fusión de Vistas Duales Basada en Tokens y Adaptación de Grandes Modelos de Visión para la Clasificación del Cáncer de Mama
Token-Based Dual-view Fusion and Adaptation of Large Vision Models for Breast Cancer Classification
July 7, 2026
Autores: Aysan Ghayouri Pirsoltan, Shima Babakordi, Mohammad Reza Mohammadi
cs.AI
Resumen
La clasificación precisa del cáncer de mama a partir de mamografías requiere la integración efectiva de información complementaria de las vistas craneocaudal (CC) y mediolateral oblicua (MLO), lo que permite una caracterización más completa de las anomalías mamarias. Sin embargo, los enfoques existentes de aprendizaje multivista suelen basarse en agregación a nivel de características o en atención cruzada de una sola etapa, lo que puede enredar representaciones específicas de cada vista y compartidas, y restringir la interacción a profundidades de red limitadas. Para abordar estas limitaciones, proponemos un marco de aprendizaje de doble vista centrado en tokens que unifica la adaptación basada en avisos (prompts) y la fusión entre vistas dentro de un backbone de transformador visual congelado. El marco reformula la interacción entre vistas como comunicación estructurada a nivel de tokens, donde tokens de fusión dedicados codifican explícitamente el intercambio bidireccional de información entre las vistas CC y MLO mediante atención cruzada, actuando como portadores intermedios de dependencias entre vistas, en lugar de depender de la fusión directa de características. A diferencia de los métodos convencionales que aplican la fusión en una sola capa, los módulos de fusión se insertan en múltiples profundidades del transformador, lo que permite una interacción progresiva y repetida a lo largo de la jerarquía del codificador. Los tokens de fusión se reintegran en la secuencia de tokens y se refinan mediante capas posteriores del transformador, facilitando la propagación jerárquica de información complementaria mientras se preserva la estructura específica de cada vista. Los experimentos en los conjuntos de datos VinDr-Mammo y CMMD demuestran mejoras consistentes sobre la sonda lineal (linear probing), la adaptación solo con avisos y las líneas base de fusión convencional. En la tarea de clasificación BI-RADS de VinDr-Mammo, el marco alcanza un 50,40% de puntuación F1 y un AUC de 0,8090, incluyendo una mejora de 0,10 en AUC sobre una línea base de fusión de doble vista en la configuración binaria. Los estudios de ablación validan además la eficacia de la fusión basada en tokens y el diseño de interacción en múltiples profundidades.
English
Accurate breast cancer classification from mammography requires effective integration of complementary information from craniocaudal (CC) and mediolateral oblique (MLO) views, which provide a more complete characterization of breast abnormalities. However, existing multi-view learning approaches typically rely on feature-level aggregation or single-stage cross-attention, which can entangle view-specific and shared representations and restrict interaction to limited network depths. To address these limitations, we propose a token-centric dual-view learning framework that unifies prompt-based adaptation and cross-view fusion within a frozen vision transformer backbone. The framework reformulates inter-view interaction as structured token-level communication, where dedicated fusion tokens explicitly encode bidirectional information exchange between CC and MLO views via cross-attention, serving as intermediate carriers of cross-view dependencies rather than relying on direct feature fusion. Unlike conventional methods that apply fusion at a single layer, fusion modules are inserted at multiple transformer depths, enabling progressive and repeated interaction across the encoder hierarchy. Fusion tokens are reintegrated into the token sequence and refined by subsequent transformer layers, facilitating hierarchical propagation of complementary information while preserving view-specific structure. Experiments on VinDr-Mammo and CMMD datasets demonstrate consistent improvements over linear probing, prompt-only adaptation, and conventional fusion baselines. On the VinDr-Mammo BI-RADS classification task, the framework achieves 50.40% F1-score and 0.8090 AUC, including a 0.10 AUC improvement over a dual-view fusion baseline in the binary setting. Ablation studies further validate the effectiveness of token-based fusion and multi-depth interaction design.