AffectFlow-DINO: учитывающая неопределенность многозадачная оценка аффекта посредством условного выпрямленного потока
AffectFlow-DINO: Uncertainty-Aware Multi-Task Affect Estimation via Conditional Rectified Flow
July 14, 2026
Авторы: Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Fadi Dornaika, Abdenour Hadid
cs.AI
Аннотация
Мы представляем AffectFlow-DINO — многозадачную систему обучения для 11-го соревнования ABAW, расширяющую стандартную детерминированную архитектуру условным блоком rectified flow для моделирования присущей неопределённости поведения лица в реальных условиях. Вместо предсказания единственной оценки аффекта модель изучает условное генеративное распределение, что позволяет осуществлять учитывающие неопределённость предсказания "один ко многим" с помощью выборки Монте-Карло. Система совместно оценивает непрерывные валентность и возбуждение, классифицирует восемь выражений лица и обнаруживает двенадцать единиц действия по статическим изображениям лиц. Построенная на замороженной базовой модели DINOv3 ViT-S/16, обширные абляционные исследования показывают, что декодирование rectified flow последовательно улучшает детерминированные предсказания, особенно для оценки валентности-возбуждения (CCC-V +0.058). Мы также показываем, что пост-хок калибровка порога эффективно восстанавливает производительность на сильно несбалансированных редких классах (например, страх: с 3,8% до 33,1%) без переобучения. В сочетании с тонкой настройкой базовой модели и повторной настройкой потока финальная модель достигает P_MTL = 1,177, существенно превосходя официальный базовый показатель соревнования P_MTL = 0,45.
English
We present AffectFlow-DINO, a multi-task learning system for the 11th ABAW challenge that extends a standard deterministic architecture with a conditional rectified-flow head to model the inherent ambiguity of in-the-wild facial behavior. Instead of predicting a single affect estimate, the model learns a conditional generative distribution, enabling uncertainty-aware one-to-many predictions through Monte Carlo sampling. The system jointly estimates continuous valence-arousal, classifies eight facial expressions, and detects twelve Action Units from static face images. Built on a frozen DINOv3 ViT-S/16 backbone, extensive ablation studies show that rectified-flow decoding consistently improves deterministic prediction, particularly for valence-arousal estimation (CCC-V +0.058). We further show that post-hoc threshold calibration effectively recovers performance on severely imbalanced rare classes (e.g., Fear: 3.8% rightarrow 33.1%) without retraining. Combined with backbone fine-tuning and flow retuning, the final model achieves P_{MTL=1.177}, substantially outperforming the official challenge baseline of P_{MTL}=0.45.