Токен-ориентированное двухвидовое слияние и адаптация больших визуальных моделей для классификации рака молочной железы
Token-Based Dual-view Fusion and Adaptation of Large Vision Models for Breast Cancer Classification
July 7, 2026
Авторы: Aysan Ghayouri Pirsoltan, Shima Babakordi, Mohammad Reza Mohammadi
cs.AI
Аннотация
Точная классификация рака молочной железы по маммографическим изображениям требует эффективной интеграции взаимодополняющей информации из краниокаудальной (CC) и медиолатеральной косой (MLO) проекций, которые обеспечивают более полную характеристику аномалий молочной железы. Однако существующие подходы многовидового обучения обычно основаны на агрегации признаков или одноэтапном кросс-внимании, что может запутывать видоспецифические и общие представления и ограничивать взаимодействие ограниченной глубиной сети. Для преодоления этих ограничений мы предлагаем токен-центричную двухпроекционную обучающую структуру, которая объединяет адаптацию на основе подсказок и кросс-проекционное слияние в рамках замороженной основы vision transformer. Предлагаемая структура переформулирует межпроекционное взаимодействие как структурированную коммуникацию на уровне токенов, где специальные токены слияния кодируют двунаправленный обмен информацией между CC- и MLO-проекциями посредством кросс-внимания, выступая в качестве промежуточных носителей кросс-проекционных зависимостей вместо прямого слияния признаков. В отличие от традиционных методов, применяющих слияние на одном слое, модули слияния встраиваются на нескольких глубинах transformer, что обеспечивает прогрессивное и повторяющееся взаимодействие по всей иерархии кодировщика. Токены слияния повторно интегрируются в последовательность токенов и уточняются последующими слоями transformer, облегчая иерархическое распространение взаимодополняющей информации с сохранением видоспецифической структуры. Эксперименты на наборах данных VinDr-Mammo и CMMD демонстрируют последовательное улучшение по сравнению с линейным пробированием, адаптацией только на основе подсказок и традиционными базовыми методами слияния. В задаче классификации BI-RADS на VinDr-Mammo предложенная структура достигает F1-меры 50,40% и AUC 0,8090, включая улучшение AUC на 0,10 по сравнению с базовым методом двухпроекционного слияния в бинарной постановке. Абляционные исследования дополнительно подтверждают эффективность слияния на основе токенов и многоуровневого взаимодействия.
English
Accurate breast cancer classification from mammography requires effective integration of complementary information from craniocaudal (CC) and mediolateral oblique (MLO) views, which provide a more complete characterization of breast abnormalities. However, existing multi-view learning approaches typically rely on feature-level aggregation or single-stage cross-attention, which can entangle view-specific and shared representations and restrict interaction to limited network depths. To address these limitations, we propose a token-centric dual-view learning framework that unifies prompt-based adaptation and cross-view fusion within a frozen vision transformer backbone. The framework reformulates inter-view interaction as structured token-level communication, where dedicated fusion tokens explicitly encode bidirectional information exchange between CC and MLO views via cross-attention, serving as intermediate carriers of cross-view dependencies rather than relying on direct feature fusion. Unlike conventional methods that apply fusion at a single layer, fusion modules are inserted at multiple transformer depths, enabling progressive and repeated interaction across the encoder hierarchy. Fusion tokens are reintegrated into the token sequence and refined by subsequent transformer layers, facilitating hierarchical propagation of complementary information while preserving view-specific structure. Experiments on VinDr-Mammo and CMMD datasets demonstrate consistent improvements over linear probing, prompt-only adaptation, and conventional fusion baselines. On the VinDr-Mammo BI-RADS classification task, the framework achieves 50.40% F1-score and 0.8090 AUC, including a 0.10 AUC improvement over a dual-view fusion baseline in the binary setting. Ablation studies further validate the effectiveness of token-based fusion and multi-depth interaction design.