ChatPaper.aiChatPaper

Pourquoi ne puis-je pas ouvrir mon tiroir ? Atténuer les raccourcis pilotés par les objets dans la reconnaissance d'actions compositionnelles en zero-shot

Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition

July 2, 2026
Auteurs: Geo Ahn, Inwoong Lee, Taeoh Kim, Minho Shim, Dongyoon Wee, Jinwoo Choi
cs.AI

Résumé

Reconnaissance Compositionnelle d'Actions Zero-Shot (ZS-CAR) nécessite d'identifier de nouvelles combinaisons verbe-objet composées de primitives déjà observées. Dans ce travail, nous abordons un mode de défaillance clé : les modèles prédisent les verbes via des raccourcis basés sur l'objet (c'est-à-dire en s'appuyant sur la classe d'objet étiquetée) plutôt que sur des preuves temporelles. Nous soutenons qu'une supervision compositionnelle éparse et une asymétrie d'apprentissage entre verbe et objet peuvent favoriser l'apprentissage de tels raccourcis. Notre analyse, à l'aide de métriques de diagnostic proposées, montre que les méthodes existantes surajustent les motifs de co-occurrence d'entraînement et sous-utilisent les indices temporels du verbe, ce qui conduit à une faible généralisation sur les compositions inédites. Pour remédier aux raccourcis basés sur l'objet, nous proposons RCORE (Représentations Compositionnelles Robustes) avec deux composantes. La Régularisation par A Priori de Co-occurrence (CPR) ajoute une supervision explicite pour les compositions inédites et régularise le modèle contre les a priori de co-occurrence fréquents en les traitant comme des négatifs difficiles. La Régularisation d'Ordre Temporel pour la Composition (TORC) impose une sensibilité à l'ordre temporel afin d'apprendre des représentations verbales ancrées temporellement. Sur Sth-com et EK100-com, RCORE réduit les indicateurs de raccourcis et améliore ainsi la généralisation compositionnelle.
English
Zero-Shot Compositional Action Recognition (ZS-CAR) requires recognizing novel verb-object combinations composed of previously observed primitives. In this work, we tackle a key failure mode: models predict verbs via object-driven shortcuts (i.e., relying on the labeled object class) rather than temporal evidence. We argue that sparse compositional supervision and verb-object learning asymmetry can promote object-driven shortcut learning. Our analysis with proposed diagnostic metrics shows that existing methods overfit to training co-occurrence patterns and underuse temporal verb cues, resulting in weak generalization to unseen compositions. To address object-driven shortcuts, we propose Robust COmpositional REpresentations (RCORE) with two components. Co-occurrence Prior Regularization (CPR) adds explicit supervision for unseen compositions and regularizes the model against frequent co-occurrence priors by treating them as hard negatives. Temporal Order Regularization for Composition (TORC) enforces temporal-order sensitivity to learn temporally grounded verb representations. Across Sth-com and EK100-com, RCORE reduces shortcut diagnostics and consequently improves compositional generalization.