¿Por qué no puedo abrir mi cajón? Mitigación de atajos impulsados por objetos en el reconocimiento de acciones composicionales de cero disparos
Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition
July 2, 2026
Autores: Geo Ahn, Inwoong Lee, Taeoh Kim, Minho Shim, Dongyoon Wee, Jinwoo Choi
cs.AI
Resumen
El Reconocimiento de Acciones Composicionales Zero-Shot (ZS-CAR) requiere reconocer nuevas combinaciones verbo-objeto compuestas por primitivas observadas previamente. En este trabajo, abordamos un modo de fallo clave: los modelos predicen verbos mediante atajos basados en objetos (es decir, dependiendo de la clase de objeto etiquetada) en lugar de evidencia temporal. Argumentamos que la supervisión composicional dispersa y la asimetría de aprendizaje verbo-objeto pueden promover el aprendizaje de atajos basados en objetos. Nuestro análisis con métricas de diagnóstico propuestas muestra que los métodos existentes se sobreajustan a los patrones de co-ocurrencia del entrenamiento y subutilizan las pistas temporales de los verbos, resultando en una débil generalización a composiciones no vistas. Para abordar los atajos basados en objetos, proponemos Robust COmpositional REpresentations (RCORE) con dos componentes. La Regularización de Prior de Co-ocurrencia (CPR) añade supervisión explícita para composiciones no vistas y regulariza el modelo contra priors de co-ocurrencia frecuente tratándolos como negativos duros. La Regularización de Orden Temporal para la Composición (TORC) impone sensibilidad al orden temporal para aprender representaciones de verbos fundamentadas temporalmente. En Sth-com y EK100-com, RCORE reduce los diagnósticos de atajos y, en consecuencia, mejora la generalización composicional.
English
Zero-Shot Compositional Action Recognition (ZS-CAR) requires recognizing novel verb-object combinations composed of previously observed primitives. In this work, we tackle a key failure mode: models predict verbs via object-driven shortcuts (i.e., relying on the labeled object class) rather than temporal evidence. We argue that sparse compositional supervision and verb-object learning asymmetry can promote object-driven shortcut learning. Our analysis with proposed diagnostic metrics shows that existing methods overfit to training co-occurrence patterns and underuse temporal verb cues, resulting in weak generalization to unseen compositions. To address object-driven shortcuts, we propose Robust COmpositional REpresentations (RCORE) with two components. Co-occurrence Prior Regularization (CPR) adds explicit supervision for unseen compositions and regularizes the model against frequent co-occurrence priors by treating them as hard negatives. Temporal Order Regularization for Composition (TORC) enforces temporal-order sensitivity to learn temporally grounded verb representations. Across Sth-com and EK100-com, RCORE reduces shortcut diagnostics and consequently improves compositional generalization.