Token-gebaseerde dual-view fusie en adaptatie van grote visiemodellen voor borstkankerclassificatie
Token-Based Dual-view Fusion and Adaptation of Large Vision Models for Breast Cancer Classification
July 7, 2026
Auteurs: Aysan Ghayouri Pirsoltan, Shima Babakordi, Mohammad Reza Mohammadi
cs.AI
Samenvatting
Nauwkeurige classificatie van borstkanker op basis van mammografie vereist een effectieve integratie van complementaire informatie uit craniocaudale (CC) en mediolaterale schuine (MLO) opnamen, die een vollediger karakterisering van borstafwijkingen mogelijk maken. Bestaande multiview-leerbenaderingen zijn echter doorgaans gebaseerd op aggregatie op kenmerkniveau of cross-attentie in één enkele fase, wat kan leiden tot verstrengeling van viewspecifieke en gedeelde representaties en de interactie kan beperken tot een beperkt aantal netwerkdiepten. Om deze beperkingen aan te pakken, stellen wij een token-gecentreerd dual-view-leerkader voor dat prompt-gebaseerde aanpassing en cross-view-fusie combineert binnen een bevroren vision-transformer-backbone. Het kader herformuleert interactie tussen views als gestructureerde tokencommunicatie, waarbij speciale fusietokens expliciet bidirectionele informatie-uitwisseling tussen CC- en MLO-opnamen coderen via cross-attentie, en dienen als intermediaire dragers van cross-view-afhankelijkheden in plaats van te vertrouwen op directe kenmerkfusie. In tegenstelling tot conventionele methoden die fusie op één enkele laag toepassen, worden fusiemodules op meerdere transformerdiepten ingevoegd, waardoor progressieve en herhaalde interactie door de encoderhiërarchie mogelijk wordt. Fusietokens worden opnieuw geïntegreerd in de tokenreeks en verfijnd door volgende transformerlagen, wat hiërarchische voortplanting van complementaire informatie bevordert met behoud van de viewspecifieke structuur. Experimenten op de datasets VinDr-Mammo en CMMD tonen consistente verbeteringen aan ten opzichte van lineaire probing, alleen prompt-aanpassing en conventionele fusie-baselines. Op de VinDr-Mammo BI-RADS-classificatietaak behaalt het kader een F1-score van 50,40% en een AUC van 0,8090, waaronder een AUC-verbetering van 0,10 ten opzichte van een dual-view-fusie-baseline in de binaire setting. Ablatiestudies bevestigen verder de effectiviteit van token-gebaseerde fusie en het interactieontwerp met meerdere diepten.
English
Accurate breast cancer classification from mammography requires effective integration of complementary information from craniocaudal (CC) and mediolateral oblique (MLO) views, which provide a more complete characterization of breast abnormalities. However, existing multi-view learning approaches typically rely on feature-level aggregation or single-stage cross-attention, which can entangle view-specific and shared representations and restrict interaction to limited network depths. To address these limitations, we propose a token-centric dual-view learning framework that unifies prompt-based adaptation and cross-view fusion within a frozen vision transformer backbone. The framework reformulates inter-view interaction as structured token-level communication, where dedicated fusion tokens explicitly encode bidirectional information exchange between CC and MLO views via cross-attention, serving as intermediate carriers of cross-view dependencies rather than relying on direct feature fusion. Unlike conventional methods that apply fusion at a single layer, fusion modules are inserted at multiple transformer depths, enabling progressive and repeated interaction across the encoder hierarchy. Fusion tokens are reintegrated into the token sequence and refined by subsequent transformer layers, facilitating hierarchical propagation of complementary information while preserving view-specific structure. Experiments on VinDr-Mammo and CMMD datasets demonstrate consistent improvements over linear probing, prompt-only adaptation, and conventional fusion baselines. On the VinDr-Mammo BI-RADS classification task, the framework achieves 50.40% F1-score and 0.8090 AUC, including a 0.10 AUC improvement over a dual-view fusion baseline in the binary setting. Ablation studies further validate the effectiveness of token-based fusion and multi-depth interaction design.