Rank-Then-Act: Beloningsvrije Sturing op Basis van Voortgang in Framevolgorde
Rank-Then-Act: Reward-Free Control from Frame-Order Progress
July 2, 2026
Auteurs: Yuriy Maksyuta, George Bredis, Ruslan Rakhimov, Daniil Gavrilov
cs.AI
Samenvatting
We introduceren Rank-Then-Act (RTA), een raamwerk voor het leren van controleringsbeleid op basis van expertvideodemonstraties zonder omgevingsbeloningen. RTA traint een Vision-Language Model (VLM) offline als een op voortgang gebaseerde ordinale scorer, met behulp van een Group Relative Policy Optimization (GRPO)-doelfunctie over geschudde framereeksen, waardoor het model wordt gedwongen temporele ordening uit visuele semantiek te herstellen in plaats van uit triviale tijdsaanwijzingen. Belangrijk is dat we, in plaats van de scorer direct als een scalair beloningsmodel te gebruiken, een op correlatie gebaseerde beloningsfunctie voor reinforcement learning voorstellen: bij elk interactievenster berekenen we de Spearman-rangcorrelatie tussen voorspelde voortgangsranglijsten en werkelijke temporele indices, wat een begrensd, schaalinvariant leersignaal oplevert. Dit ontwerp ontkoppelt het leren van beloningen van absolute kalibratie en maakt stabiele overdracht tussen taken en omgevingen mogelijk. We evalueren RTA op discrete besturingsbenchmarks (PyBoy: Catrap, Kirby) en continue besturingstaken (PointMaze, MetaWorld). RTA presteert consequent even goed of beter dan eerdere op video gebaseerde methoden voor het leren van beloningen en op ranglijsten gebaseerde baselines, en vertoont een sterke cross-task-hergebruik van een enkele vooraf getrainde voortgangsscorer. Onze resultaten suggereren dat correlatiegestructureerde supervisie over van video afgeleide ordinale signalen voldoende is voor beleidsleren, en biedt een schaalbare alternatief voor expliciet beloningsontwerp.
English
We introduce Rank-Then-Act (RTA), a framework for learning control policies from expert video demonstrations without environment rewards. RTA trains a Vision-Language Model (VLM) offline as a progress-based ordinal scorer, using a Group Relative Policy Optimization (GRPO) objective over shuffled frame sequences, which forces the model to recover temporal ordering from visual semantics rather than trivial time cues. Importantly, instead of using the scorer directly as a scalar reward model, we propose a correlation-based reward function for reinforcement learning: at each interaction window, we compute the Spearman rank correlation between predicted progress rankings and true temporal indices, yielding a bounded, scale-invariant learning signal. This design decouples reward learning from absolute calibration and enables stable transfer across tasks and environments. We evaluate RTA on discrete control benchmarks (PyBoy: Catrap, Kirby) and continuous control tasks (PointMaze, MetaWorld). RTA consistently matches or outperforms prior video-based reward learning methods and rank-based baselines, while demonstrating strong cross-task reuse of a single pretrained progress scorer. Our results suggest that correlation-structured supervision over video-derived ordinal signals is sufficient for policy learning, offering a scalable alternative to explicit reward design.