Por que não consigo abrir minha gaveta? Mitigando atalhos orientados por objetos no reconhecimento de ações composicionais zero-shot
Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition
July 2, 2026
Autores: Geo Ahn, Inwoong Lee, Taeoh Kim, Minho Shim, Dongyoon Wee, Jinwoo Choi
cs.AI
Resumo
O Reconhecimento de Ação Composicional Zero-Shot (ZS-CAR) exige o reconhecimento de novas combinações verbo-objeto compostas por primitivas previamente observadas. Neste trabalho, abordamos um modo crítico de falha: modelos predizem verbos por meio de atalhos orientados por objeto (ou seja, baseados na classe rotulada do objeto) em vez de evidências temporais. Argumentamos que a supervisão composicional esparsa e a assimetria de aprendizado verbo-objeto podem promover o aprendizado de atalhos orientados por objeto. Nossa análise, utilizando métricas de diagnóstico propostas, mostra que métodos existentes superajustam padrões de coocorrência de treinamento e subutilizam pistas verbais temporais, resultando em fraca generalização para composições não vistas. Para lidar com atalhos orientados por objeto, propomos as Representações Composicionais Robustas (RCORE) com dois componentes. A Regularização de Prior de Coocorrência (CPR) adiciona supervisão explícita para composições não vistas e regulariza o modelo contra priors frequentes de coocorrência, tratando-os como negativos difíceis. A Regularização de Ordem Temporal para Composição (TORC) impõe sensibilidade à ordem temporal para aprender representações verbais fundamentadas temporalmente. Em Sth-com e EK100-com, RCORE reduz os diagnósticos de atalhos e, consequentemente, melhora a generalização composicional.
English
Zero-Shot Compositional Action Recognition (ZS-CAR) requires recognizing novel verb-object combinations composed of previously observed primitives. In this work, we tackle a key failure mode: models predict verbs via object-driven shortcuts (i.e., relying on the labeled object class) rather than temporal evidence. We argue that sparse compositional supervision and verb-object learning asymmetry can promote object-driven shortcut learning. Our analysis with proposed diagnostic metrics shows that existing methods overfit to training co-occurrence patterns and underuse temporal verb cues, resulting in weak generalization to unseen compositions. To address object-driven shortcuts, we propose Robust COmpositional REpresentations (RCORE) with two components. Co-occurrence Prior Regularization (CPR) adds explicit supervision for unseen compositions and regularizes the model against frequent co-occurrence priors by treating them as hard negatives. Temporal Order Regularization for Composition (TORC) enforces temporal-order sensitivity to learn temporally grounded verb representations. Across Sth-com and EK100-com, RCORE reduces shortcut diagnostics and consequently improves compositional generalization.