ChatPaper.aiChatPaper

AffectFlow-DINO: Estimação de Afeto Multitarefa Consciente de Incerteza através de Fluxo Retificado Condicional

AffectFlow-DINO: Uncertainty-Aware Multi-Task Affect Estimation via Conditional Rectified Flow

July 14, 2026
Autores: Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Fadi Dornaika, Abdenour Hadid
cs.AI

Resumo

Apresentamos o AffectFlow-DINO, um sistema de aprendizado multitarefa para o 11º desafio ABAW que estende uma arquitetura determinística padrão com uma cabeça de fluxo retificado condicional para modelar a ambiguidade inerente do comportamento facial em condições reais. Em vez de prever uma única estimativa de afeto, o modelo aprende uma distribuição generativa condicional, possibilitando previsões um-para-muitos com consciência de incerteza por meio de amostragem de Monte Carlo. O sistema estima conjuntamente valência-excitação contínuas, classifica oito expressões faciais e detecta doze Unidades de Ação a partir de imagens faciais estáticas. Construído sobre um backbone DINOv3 ViT-S/16 congelado, estudos de ablação extensivos mostram que a decodificação de fluxo retificado melhora consistentemente a previsão determinística, particularmente para a estimativa de valência-excitação (CCC-V +0,058). Mostramos ainda que a calibragem de limiar post-hoc recupera efetivamente o desempenho em classes raras severamente desbalanceadas (ex.: Medo: 3,8% → 33,1%) sem necessidade de retreinamento. Combinado com ajuste fino do backbone e reajuste do fluxo, o modelo final alcança P_{MTL}=1,177, superando substancialmente a linha de base oficial do desafio de P_{MTL}=0,45.
English
We present AffectFlow-DINO, a multi-task learning system for the 11th ABAW challenge that extends a standard deterministic architecture with a conditional rectified-flow head to model the inherent ambiguity of in-the-wild facial behavior. Instead of predicting a single affect estimate, the model learns a conditional generative distribution, enabling uncertainty-aware one-to-many predictions through Monte Carlo sampling. The system jointly estimates continuous valence-arousal, classifies eight facial expressions, and detects twelve Action Units from static face images. Built on a frozen DINOv3 ViT-S/16 backbone, extensive ablation studies show that rectified-flow decoding consistently improves deterministic prediction, particularly for valence-arousal estimation (CCC-V +0.058). We further show that post-hoc threshold calibration effectively recovers performance on severely imbalanced rare classes (e.g., Fear: 3.8% rightarrow 33.1%) without retraining. Combined with backbone fine-tuning and flow retuning, the final model achieves P_{MTL=1.177}, substantially outperforming the official challenge baseline of P_{MTL}=0.45.