ChatPaper.aiChatPaper

Estimação Eficiente de Parâmetros de Proficiência Multivisão: Da Classificação Discriminativa ao Feedback Generativo

Parameter-Efficient Multi-View Proficiency Estimation: From Discriminative Classification to Generative Feedback

May 5, 2026
Autores: Edoardo Bianchi, Antonio Liotta
cs.AI

Resumo

Estimar quão bem uma pessoa executa uma ação, em vez de determinar qual ação é realizada, é fundamental para o treinamento, reabilitação e identificação de talentos. Esta tarefa é desafiadora porque a proficiência é codificada em diferenças sutis de temporização, equilíbrio, biomecânica e execução, frequentemente distribuídas por múltiplos ângulos de visão e eventos temporais curtos. Discutimos três contribuições recentes para a estimativa de proficiência multi-visão no Ego-Exo4D. O SkillFormer introduz uma arquitetura discriminativa com eficiência de parâmetros para fusão seletiva multi-visão; o PATS melhora a amostragem temporal ao preservar trechos localmente densos de movimentos fundamentais; e o ProfVLM reformula a estimativa de proficiência como uma geração de linguagem condicional, produzindo tanto uma classificação de proficiência quanto um feedback no estilo de um especialista através de um projetor cruzado com gate e um backbone de linguagem compacto. Juntos, esses métodos alcançam precisão de última geração no Ego-Exo4D com até 20 vezes menos parâmetros treináveis e até 3 vezes menos épocas de treinamento do que os baselines baseados em video-transformers, enquanto evoluem da classificação de conjunto fechado para a geração de feedback interpretável. Esses resultados destacam uma mudança em direção a sistemas multi-visão eficientes que combinam fusão seletiva, amostragem consciente da proficiência e feedback generativo acionável.
English
Estimating how well a person performs an action, rather than which action is performed, is central to coaching, rehabilitation, and talent identification. This task is challenging because proficiency is encoded in subtle differences in timing, balance, body mechanics, and execution, often distributed across multiple views and short temporal events. We discuss three recent contributions to multi-view proficiency estimation on Ego-Exo4D. SkillFormer introduces a parameter-efficient discriminative architecture for selective multi-view fusion; PATS improves temporal sampling by preserving locally dense excerpts of fundamental movements; and ProfVLM reformulates proficiency estimation as conditional language generation, producing both a proficiency label and expert-style feedback through a gated cross-view projector and a compact language backbone. Together, these methods achieve state-of-the-art accuracy on Ego-Exo4D with up to 20x fewer trainable parameters and up to 3x fewer training epochs than video-transformer baselines, while moving from closed-set classification toward interpretable feedback generation. These results highlight a shift toward efficient, multi-view systems that combine selective fusion, proficiency-aware sampling, and actionable generative feedback.