AffectFlow-DINO : Estimation multi-tâche de l'affect avec prise en compte de l'incertitude via un flux rectifié conditionnel
AffectFlow-DINO: Uncertainty-Aware Multi-Task Affect Estimation via Conditional Rectified Flow
July 14, 2026
Auteurs: Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Fadi Dornaika, Abdenour Hadid
cs.AI
Résumé
Nous présentons AffectFlow-DINO, un système d’apprentissage multitâche pour le 11e défi ABAW qui étend une architecture déterministe standard avec une tête de flux rectifié conditionnel afin de modéliser l’ambiguïté inhérente des comportements faciaux en conditions naturelles. Au lieu de prédire une seule estimation d’affect, le modèle apprend une distribution générative conditionnelle, permettant des prédictions un-à-plusieurs conscientes de l’incertitude via un échantillonnage de Monte Carlo. Le système estime conjointement une valence-arousal continue, classifie huit expressions faciales et détecte douze Unités d’Action à partir d’images faciales statiques. Construit sur un backbone DINOv3 ViT-S/16 figé, des études d’ablation approfondies montrent que le décodage par flux rectifié améliore systématiquement la prédiction déterministe, en particulier pour l’estimation valence-arousal (CCC-V +0,058). Nous montrons en outre qu’un calibrage a posteriori des seuils permet de récupérer efficacement la performance sur des classes rares fortement déséquilibrées (par exemple, Peur : 3,8 % → 33,1 %) sans réentraînement. Combiné avec le réglage fin du backbone et le réajustement du flux, le modèle final atteint P_{MTL}=1,177, surpassant nettement le score de référence officiel du défi, P_{MTL}=0,45.
English
We present AffectFlow-DINO, a multi-task learning system for the 11th ABAW challenge that extends a standard deterministic architecture with a conditional rectified-flow head to model the inherent ambiguity of in-the-wild facial behavior. Instead of predicting a single affect estimate, the model learns a conditional generative distribution, enabling uncertainty-aware one-to-many predictions through Monte Carlo sampling. The system jointly estimates continuous valence-arousal, classifies eight facial expressions, and detects twelve Action Units from static face images. Built on a frozen DINOv3 ViT-S/16 backbone, extensive ablation studies show that rectified-flow decoding consistently improves deterministic prediction, particularly for valence-arousal estimation (CCC-V +0.058). We further show that post-hoc threshold calibration effectively recovers performance on severely imbalanced rare classes (e.g., Fear: 3.8% rightarrow 33.1%) without retraining. Combined with backbone fine-tuning and flow retuning, the final model achieves P_{MTL=1.177}, substantially outperforming the official challenge baseline of P_{MTL}=0.45.