ChatPaper.aiChatPaper

AffectFlow-DINO: Unsicherheitsbewusste Multi-Task-Affektschätzung mittels bedingten korrigierten Flusses

AffectFlow-DINO: Uncertainty-Aware Multi-Task Affect Estimation via Conditional Rectified Flow

July 14, 2026
Autoren: Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Fadi Dornaika, Abdenour Hadid
cs.AI

Zusammenfassung

Wir präsentieren AffectFlow-DINO, ein Multi-Task-Lernsystem für die 11. ABAW-Challenge, das eine standardmäßige deterministische Architektur um einen bedingten Kopf mit korrigiertem Fluss erweitert, um die inhärente Ambiguität von Gesichtsverhalten im Freifeld zu modellieren. Anstatt eine einzelne Schätzung des Affekts vorherzusagen, lernt das Modell eine bedingte generative Verteilung, die durch Monte-Carlo-Sampling unsicherheitsbewusste Eine-zu-Viele-Vorhersagen ermöglicht. Das System schätzt gleichzeitig kontinuierliche Valenz-Arousal-Werte, klassifiziert acht Gesichtsausdrücke und erkennt zwölf Aktions-Einheiten aus statischen Gesichtsbildern. Aufbauend auf einem eingefrorenen DINOv3 ViT-S/16-Backbone zeigen umfangreiche Ablationsstudien, dass die Decodierung mit korrigiertem Fluss die deterministische Vorhersage konsequent verbessert, insbesondere bei der Valenz-Arousal-Schätzung (CCC-V +0,058). Wir zeigen weiterhin, dass eine nachträgliche Schwellenwertkalibrierung die Leistung bei stark unbalancierten seltenen Klassen (z. B. Angst: 3,8 % → 33,1 %) ohne erneutes Training effektiv wiederherstellt. In Kombination mit Feinabstimmung des Backbones und Nachjustierung des Flusses erreicht das endgültige Modell P_MTL = 1,177 und übertrifft damit die offizielle Challenge-Baseline von P_MTL = 0,45 deutlich.
English
We present AffectFlow-DINO, a multi-task learning system for the 11th ABAW challenge that extends a standard deterministic architecture with a conditional rectified-flow head to model the inherent ambiguity of in-the-wild facial behavior. Instead of predicting a single affect estimate, the model learns a conditional generative distribution, enabling uncertainty-aware one-to-many predictions through Monte Carlo sampling. The system jointly estimates continuous valence-arousal, classifies eight facial expressions, and detects twelve Action Units from static face images. Built on a frozen DINOv3 ViT-S/16 backbone, extensive ablation studies show that rectified-flow decoding consistently improves deterministic prediction, particularly for valence-arousal estimation (CCC-V +0.058). We further show that post-hoc threshold calibration effectively recovers performance on severely imbalanced rare classes (e.g., Fear: 3.8% rightarrow 33.1%) without retraining. Combined with backbone fine-tuning and flow retuning, the final model achieves P_{MTL=1.177}, substantially outperforming the official challenge baseline of P_{MTL}=0.45.