ChatPaper.aiChatPaper

AffectFlow-DINO: Estimación de Afecto Multi-Tarea Consciente de la Incertidumbre mediante Flujo Rectificado Condicional

AffectFlow-DINO: Uncertainty-Aware Multi-Task Affect Estimation via Conditional Rectified Flow

July 14, 2026
Autores: Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Fadi Dornaika, Abdenour Hadid
cs.AI

Resumen

Presentamos AffectFlow-DINO, un sistema de aprendizaje multitarea para el desafío ABAW 11 que extiende una arquitectura determinista estándar con una cabeza de flujo rectificado condicional para modelar la ambigüedad inherente del comportamiento facial en entornos naturales. En lugar de predecir una única estimación afectiva, el modelo aprende una distribución generativa condicional, lo que permite predicciones uno-a-muchos con conciencia de incertidumbre mediante muestreo de Monte Carlo. El sistema estima conjuntamente valencia-excitación continua, clasifica ocho expresiones faciales y detecta doce Unidades de Acción a partir de imágenes faciales estáticas. Construido sobre un backbone DINOv3 ViT-S/16 congelado, estudios de ablación exhaustivos muestran que la decodificación mediante flujo rectificado mejora consistentemente la predicción determinista, particularmente para la estimación de valencia-excitación (CCC-V +0.058). Además, demostramos que la calibración umbral post-hoc recupera efectivamente el rendimiento en clases raras severamente desbalanceadas (p. ej., Miedo: 3.8% → 33.1%) sin necesidad de reentrenamiento. Combinado con el ajuste fino del backbone y el reajuste del flujo, el modelo final alcanza un P_{MTL}=1.177, superando sustancialmente la línea base oficial del desafío de P_{MTL}=0.45.
English
We present AffectFlow-DINO, a multi-task learning system for the 11th ABAW challenge that extends a standard deterministic architecture with a conditional rectified-flow head to model the inherent ambiguity of in-the-wild facial behavior. Instead of predicting a single affect estimate, the model learns a conditional generative distribution, enabling uncertainty-aware one-to-many predictions through Monte Carlo sampling. The system jointly estimates continuous valence-arousal, classifies eight facial expressions, and detects twelve Action Units from static face images. Built on a frozen DINOv3 ViT-S/16 backbone, extensive ablation studies show that rectified-flow decoding consistently improves deterministic prediction, particularly for valence-arousal estimation (CCC-V +0.058). We further show that post-hoc threshold calibration effectively recovers performance on severely imbalanced rare classes (e.g., Fear: 3.8% rightarrow 33.1%) without retraining. Combined with backbone fine-tuning and flow retuning, the final model achieves P_{MTL=1.177}, substantially outperforming the official challenge baseline of P_{MTL}=0.45.