Fusion à double vue basée sur des tokens et adaptation de grands modèles de vision pour la classification du cancer du sein
Token-Based Dual-view Fusion and Adaptation of Large Vision Models for Breast Cancer Classification
July 7, 2026
Auteurs: Aysan Ghayouri Pirsoltan, Shima Babakordi, Mohammad Reza Mohammadi
cs.AI
Résumé
Une classification précise du cancer du sein par mammographie nécessite l'intégration efficace d'informations complémentaires provenant des vues craniocaudales (CC) et médiolatérales obliques (MLO), qui permettent une caractérisation plus complète des anomalies mammaires. Cependant, les approches existantes d'apprentissage multivue reposent généralement sur une agrégation au niveau des caractéristiques ou une attention croisée monocouche, ce qui peut entremêler les représentations spécifiques à chaque vue et partagées, et limiter l'interaction à des profondeurs de réseau restreintes. Pour pallier ces limitations, nous proposons un cadre d'apprentissage bivue centré sur les tokens qui unifie l'adaptation par amorces et la fusion inter-vues au sein d'un backbone de transformateur de vision figé. Ce cadre reformule l'interaction entre les vues comme une communication structurée au niveau des tokens, où des tokens de fusion dédiés encodent explicitement l'échange bidirectionnel d'informations entre les vues CC et MLO via une attention croisée, servant de vecteurs intermédiaires pour les dépendances croisées entre vues, plutôt que de s'appuyer sur une fusion directe des caractéristiques. Contrairement aux méthodes conventionnelles qui appliquent la fusion à une seule couche, des modules de fusion sont insérés à plusieurs profondeurs du transformateur, permettant une interaction progressive et répétée à travers la hiérarchie de l'encodeur. Les tokens de fusion sont réintégrés dans la séquence de tokens et affinés par les couches subséquentes du transformateur, facilitant la propagation hiérarchique d'informations complémentaires tout en préservant la structure spécifique à chaque vue. Des expériences sur les jeux de données VinDr-Mammo et CMMD montrent des améliorations constantes par rapport au sondage linéaire, à l'adaptation par amorces uniquement et aux références de fusion conventionnelles. Sur la tâche de classification BI-RADS de VinDr-Mammo, le cadre atteint un score F1 de 50,40 % et une AUC de 0,8090, incluant une amélioration de 0,10 de l'AUC par rapport à une référence de fusion bivue dans le contexte binaire. Des études d'ablation valident en outre l'efficacité de la fusion basée sur les tokens et de la conception d'interaction à plusieurs profondeurs.
English
Accurate breast cancer classification from mammography requires effective integration of complementary information from craniocaudal (CC) and mediolateral oblique (MLO) views, which provide a more complete characterization of breast abnormalities. However, existing multi-view learning approaches typically rely on feature-level aggregation or single-stage cross-attention, which can entangle view-specific and shared representations and restrict interaction to limited network depths. To address these limitations, we propose a token-centric dual-view learning framework that unifies prompt-based adaptation and cross-view fusion within a frozen vision transformer backbone. The framework reformulates inter-view interaction as structured token-level communication, where dedicated fusion tokens explicitly encode bidirectional information exchange between CC and MLO views via cross-attention, serving as intermediate carriers of cross-view dependencies rather than relying on direct feature fusion. Unlike conventional methods that apply fusion at a single layer, fusion modules are inserted at multiple transformer depths, enabling progressive and repeated interaction across the encoder hierarchy. Fusion tokens are reintegrated into the token sequence and refined by subsequent transformer layers, facilitating hierarchical propagation of complementary information while preserving view-specific structure. Experiments on VinDr-Mammo and CMMD datasets demonstrate consistent improvements over linear probing, prompt-only adaptation, and conventional fusion baselines. On the VinDr-Mammo BI-RADS classification task, the framework achieves 50.40% F1-score and 0.8090 AUC, including a 0.10 AUC improvement over a dual-view fusion baseline in the binary setting. Ablation studies further validate the effectiveness of token-based fusion and multi-depth interaction design.