Почему я не могу открыть свой ящик? Смягчение объектных шорткатов в zero-shot распознавании композиционных действий
Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition
July 2, 2026
Авторы: Geo Ahn, Inwoong Lee, Taeoh Kim, Minho Shim, Dongyoon Wee, Jinwoo Choi
cs.AI
Аннотация
Распознавание композиционных действий в условиях нулевого обучения (ZS-CAR) требует распознавания новых комбинаций глагол-объект, составленных из ранее наблюдаемых примитивов. В данной работе мы рассматриваем ключевую проблему: модели предсказывают глаголы с помощью объектно-ориентированных сокращений (т.е. полагаясь на класс помеченного объекта), а не на временные свидетельства. Мы утверждаем, что разреженное композиционное обучение и асимметрия в обучении глаголов и объектов могут способствовать изучению объектно-ориентированных сокращений. Наш анализ с помощью предложенных диагностических метрик показывает, что существующие методы переобучаются на паттерны совместной встречаемости в обучающем наборе и недостаточно используют временные признаки глаголов, что приводит к слабой обобщаемости на невидимые композиции. Для устранения объектно-ориентированных сокращений мы предлагаем Robust COmpositional REpresentations (RCORE) с двумя компонентами. Регуляризация априорной совместной встречаемости (CPR) добавляет явное обучение для невидимых композиций и регуляризует модель против частых априорных совместных встречаемостей, рассматривая их как сложные отрицательные примеры. Регуляризация временного порядка для композиций (TORC) обеспечивает чувствительность к временному порядку для изучения временно обоснованных представлений глаголов. На наборах данных Sth-com и EK100-com RCORE снижает диагностику сокращений и, следовательно, улучшает композиционную обобщаемость.
English
Zero-Shot Compositional Action Recognition (ZS-CAR) requires recognizing novel verb-object combinations composed of previously observed primitives. In this work, we tackle a key failure mode: models predict verbs via object-driven shortcuts (i.e., relying on the labeled object class) rather than temporal evidence. We argue that sparse compositional supervision and verb-object learning asymmetry can promote object-driven shortcut learning. Our analysis with proposed diagnostic metrics shows that existing methods overfit to training co-occurrence patterns and underuse temporal verb cues, resulting in weak generalization to unseen compositions. To address object-driven shortcuts, we propose Robust COmpositional REpresentations (RCORE) with two components. Co-occurrence Prior Regularization (CPR) adds explicit supervision for unseen compositions and regularizes the model against frequent co-occurrence priors by treating them as hard negatives. Temporal Order Regularization for Composition (TORC) enforces temporal-order sensitivity to learn temporally grounded verb representations. Across Sth-com and EK100-com, RCORE reduces shortcut diagnostics and consequently improves compositional generalization.