ChatPaper.aiChatPaper

EX-FIQA : Exploitation des représentations intermédiaires de sortie anticipée (eXit) des Vision Transformers pour l'évaluation de la qualité des images faciales

EX-FIQA: Leveraging Intermediate Early eXit Representations from Vision Transformers for Face Image Quality Assessment

April 21, 2026
Auteurs: Guray Ozgur, Tahar Chettaoui, Eduarda Caldeira, Jan Niklas Kolf, Andrea Atzori, Fadi Boutros, Naser Damer
cs.AI

Résumé

L'évaluation de la qualité des images faciales est cruciale pour la fiabilité des systèmes de reconnaissance faciale. Pourtant, les approches existantes basées sur les Vision Transformers s'appuient exclusivement sur les représentations de la couche finale, ignorant les informations pertinentes pour la qualité capturées aux profondeurs intermédiaires du réseau. Cet article présente la première investigation exhaustive de la contribution des représentations intermédiaires des ViTs à l'évaluation de la qualité faciale via des mécanismes de sortie anticipée et des stratégies de fusion de scores. Nous analysons systématiquement les douze blocs transformateurs des architectures ViT-FIQA, démontrant que différentes profondeurs capturent des informations distinctes et complémentaires liées à la qualité, comme en témoignent les variations des patterns d'attention et des caractéristiques de performance entre les couches du réseau. Nous proposons un cadre de fusion de scores qui combine les prédictions de qualité de plusieurs blocs transformateurs sans modification architecturale ni entraînement supplémentaire. Notre analyse des sorties anticipées révèle des compromis performance-efficacité optimaux, permettant des économies de calcul significatives tout en maintenant des performances compétitives. Grâce à une évaluation approfondie sur huit bases de référence utilisant quatre modèles de reconnaissance faciale, nous démontrons que notre stratégie de fusion surpasse les approches à sortie unique. Notre approche de fusion de qualité propose une moyenne pondérée par la profondeur qui attribue une importance progressivement plus élevée aux blocs transformateurs plus profonds, atteignant ainsi les meilleures performances d'évaluation de la qualité en exploitant efficacement la nature hiérarchique de l'apprentissage des caractéristiques dans les ViTs. Notre travail remet en cause l'idée conventionnelle selon laquelle seules les caractéristiques profondes comptent pour l'analyse faciale, révélant que les représentations intermédiaires contiennent des informations précieuses pour l'évaluation de la qualité. Le cadre proposé offre des avantages pratiques pour les systèmes biométriques en conditions réelles en permettant un calcul adaptatif basé sur les contraintes de ressources tout en maintenant des capacités d'évaluation de la qualité compétitives.
English
Face Image Quality Assessment is crucial for reliable face recognition systems, yet existing Vision Transformer-based approaches rely exclusively on final-layer representations, ignoring quality-relevant information captured at intermediate network depths. This paper presents the first comprehensive investigation of how intermediate representations within ViTs contribute to face quality assessment through early exit mechanisms and score fusion strategies. We systematically analyze all twelve transformer blocks of ViT-FIQA architectures, demonstrating that different depths capture distinct and complementary quality-relevant information, as evidenced by varying attention patterns and performance characteristics across network layers. We propose a score fusion framework that combines quality predictions from multiple transformer blocks without architectural modifications or additional training. Our early exit analysis reveals optimal performance-efficiency trade-offs, enabling significant computational savings while maintaining competitive performance. Through extensive evaluation across eight benchmark datasets using four FR models, we demonstrate that our fusion strategy improves upon single-exit approaches. Our proposed quality fusion approach employs depth-weighted averaging that assigns progressively higher importance to deeper transformer blocks, achieving the best quality assessment performance by effectively leveraging the hierarchical nature of feature learning in ViTs. Our work challenges the conventional wisdom that only deep features matter for face analysis, revealing that intermediate representations contain valuable information for quality assessment. The proposed framework offers practical benefits for real-world biometric systems by enabling adaptive computation based on resource constraints while maintaining competitive quality assessment capabilities.