ChatPaper.aiChatPaper

Classer puis agir : Contrôle sans récompense à partir de la progression de l'ordre des trames

Rank-Then-Act: Reward-Free Control from Frame-Order Progress

July 2, 2026
Auteurs: Yuriy Maksyuta, George Bredis, Ruslan Rakhimov, Daniil Gavrilov
cs.AI

Résumé

Nous présentons Rank-Then-Act (RTA), un cadre d’apprentissage de politiques de contrôle à partir de démonstrations vidéo d’experts sans recours à des récompenses environnementales. RTA entraîne un modèle vision-langage (VLM) hors ligne en tant que scoreur ordinal basé sur la progression, en utilisant un objectif d’Optimisation Relative de Politique de Groupe (GRPO) sur des séquences d’images mélangées, ce qui contraint le modèle à retrouver l’ordre temporel à partir de la sémantique visuelle plutôt que d’indices temporels triviaux. Surtout, plutôt que d’utiliser directement le scoreur comme un modèle de récompense scalaire, nous proposons une fonction de récompense fondée sur la corrélation pour l’apprentissage par renforcement : à chaque fenêtre d’interaction, nous calculons la corrélation de rang de Spearman entre les classements de progression prédits et les indices temporels réels, produisant ainsi un signal d’apprentissage borné et invariant à l’échelle. Cette conception dissocie l’apprentissage de la récompense de l’étalonnage absolu et permet un transfert stable entre tâches et environnements. Nous évaluons RTA sur des références de contrôle discret (PyBoy : Catrap, Kirby) et des tâches de contrôle continu (PointMaze, MetaWorld). RTA égalise ou dépasse systématiquement les méthodes antérieures d’apprentissage de récompense par vidéo et les approches de référence basées sur les rangs, tout en démontrant une forte réutilisation inter-tâches d’un unique scoreur de progression pré-entraîné. Nos résultats suggèrent qu’une supervision structurée par corrélation sur des signaux ordinaux issus de vidéos est suffisante pour l’apprentissage de politiques, offrant une alternative scalable à la conception explicite de récompenses.
English
We introduce Rank-Then-Act (RTA), a framework for learning control policies from expert video demonstrations without environment rewards. RTA trains a Vision-Language Model (VLM) offline as a progress-based ordinal scorer, using a Group Relative Policy Optimization (GRPO) objective over shuffled frame sequences, which forces the model to recover temporal ordering from visual semantics rather than trivial time cues. Importantly, instead of using the scorer directly as a scalar reward model, we propose a correlation-based reward function for reinforcement learning: at each interaction window, we compute the Spearman rank correlation between predicted progress rankings and true temporal indices, yielding a bounded, scale-invariant learning signal. This design decouples reward learning from absolute calibration and enables stable transfer across tasks and environments. We evaluate RTA on discrete control benchmarks (PyBoy: Catrap, Kirby) and continuous control tasks (PointMaze, MetaWorld). RTA consistently matches or outperforms prior video-based reward learning methods and rank-based baselines, while demonstrating strong cross-task reuse of a single pretrained progress scorer. Our results suggest that correlation-structured supervision over video-derived ordinal signals is sufficient for policy learning, offering a scalable alternative to explicit reward design.