ChatPaper.aiChatPaper

Ordenar y luego actuar: control sin recompensa a partir del progreso del orden de los fotogramas

Rank-Then-Act: Reward-Free Control from Frame-Order Progress

July 2, 2026
Autores: Yuriy Maksyuta, George Bredis, Ruslan Rakhimov, Daniil Gavrilov
cs.AI

Resumen

Presentamos Rank-Then-Act (RTA), un marco de trabajo para aprender políticas de control a partir de demostraciones en video de expertos sin necesidad de recompensas del entorno. RTA entrena un Modelo de Lenguaje y Visión (VLM) fuera de línea como un clasificador ordinal basado en progreso, utilizando un objetivo de Optimización Relativa de Políticas por Grupos (GRPO) sobre secuencias de fotogramas barajadas, lo que obliga al modelo a recuperar el orden temporal a partir de semánticas visuales en lugar de señales temporales triviales. Es importante destacar que, en lugar de usar el clasificador directamente como un modelo de recompensa escalar, proponemos una función de recompensa basada en correlación para el aprendizaje por refuerzo: en cada ventana de interacción, calculamos la correlación de rangos de Spearman entre las clasificaciones de progreso predichas y los índices temporales reales, obteniendo una señal de aprendizaje acotada e invariante a la escala. Este diseño desacopla el aprendizaje de la recompensa de la calibración absoluta y permite una transferencia estable entre tareas y entornos. Evaluamos RTA en puntos de referencia de control discreto (PyBoy: Catrap, Kirby) y tareas de control continuo (PointMaze, MetaWorld). RTA iguala o supera consistentemente a métodos previos de aprendizaje de recompensas basados en video y líneas base basadas en rangos, demostrando un fuerte reutilización entre tareas de un único clasificador de progreso preentrenado. Nuestros resultados sugieren que la supervisión estructurada por correlación sobre señales ordinales derivadas de video es suficiente para el aprendizaje de políticas, ofreciendo una alternativa escalable al diseño explícito de recompensas.
English
We introduce Rank-Then-Act (RTA), a framework for learning control policies from expert video demonstrations without environment rewards. RTA trains a Vision-Language Model (VLM) offline as a progress-based ordinal scorer, using a Group Relative Policy Optimization (GRPO) objective over shuffled frame sequences, which forces the model to recover temporal ordering from visual semantics rather than trivial time cues. Importantly, instead of using the scorer directly as a scalar reward model, we propose a correlation-based reward function for reinforcement learning: at each interaction window, we compute the Spearman rank correlation between predicted progress rankings and true temporal indices, yielding a bounded, scale-invariant learning signal. This design decouples reward learning from absolute calibration and enables stable transfer across tasks and environments. We evaluate RTA on discrete control benchmarks (PyBoy: Catrap, Kirby) and continuous control tasks (PointMaze, MetaWorld). RTA consistently matches or outperforms prior video-based reward learning methods and rank-based baselines, while demonstrating strong cross-task reuse of a single pretrained progress scorer. Our results suggest that correlation-structured supervision over video-derived ordinal signals is sufficient for policy learning, offering a scalable alternative to explicit reward design.