ChatPaper.aiChatPaper

Ранжируй-Затем-Действуй: управление без вознаграждений на основе прогресса порядка кадров

Rank-Then-Act: Reward-Free Control from Frame-Order Progress

July 2, 2026
Авторы: Yuriy Maksyuta, George Bredis, Ruslan Rakhimov, Daniil Gavrilov
cs.AI

Аннотация

Мы представляем подход «Ранжируй-Затем-Действуй» (Rank-Then-Act, RTA) — фреймворк для обучения управляющих политик на основе видеоэкспертных демонстраций без использования внешних вознаграждений среды. RTA обучает модель «видение-язык» (Vision-Language Model, VLM) в автономном режиме как порядковый оценщик прогресса, используя цель групповой оптимизации относительной политики (Group Relative Policy Optimization, GRPO) на перемешанных последовательностях кадров. Это заставляет модель восстанавливать временной порядок на основе визуальной семантики, а не тривиальных временных подсказок. Важно, что вместо прямого использования оценщика как скалярной модели вознаграждения мы предлагаем функцию вознаграждения на основе корреляции для обучения с подкреплением: на каждом окне взаимодействия вычисляется ранговый коэффициент корреляции Спирмена между предсказанными рангами прогресса и истинными временными индексами, что даёт ограниченный, инвариантный к масштабу сигнал обучения. Такая конструкция отделяет обучение вознаграждению от абсолютной калибровки и обеспечивает стабильный перенос между задачами и средами. Мы оцениваем RTA на эталонных задачах дискретного управления (PyBoy: Catrap, Kirby) и непрерывного управления (PointMaze, MetaWorld). RTA стабильно достигает или превосходит результаты предыдущих методов обучения вознаграждению на основе видео и ранговых базовых линий, демонстрируя при этом сильное переиспользование одного предобученного оценщика прогресса на разных задачах. Наши результаты показывают, что структурированная корреляция с использованием порядковых сигналов, полученных из видео, достаточна для обучения политик, предлагая масштабируемую альтернативу явному конструированию вознаграждений.
English
We introduce Rank-Then-Act (RTA), a framework for learning control policies from expert video demonstrations without environment rewards. RTA trains a Vision-Language Model (VLM) offline as a progress-based ordinal scorer, using a Group Relative Policy Optimization (GRPO) objective over shuffled frame sequences, which forces the model to recover temporal ordering from visual semantics rather than trivial time cues. Importantly, instead of using the scorer directly as a scalar reward model, we propose a correlation-based reward function for reinforcement learning: at each interaction window, we compute the Spearman rank correlation between predicted progress rankings and true temporal indices, yielding a bounded, scale-invariant learning signal. This design decouples reward learning from absolute calibration and enables stable transfer across tasks and environments. We evaluate RTA on discrete control benchmarks (PyBoy: Catrap, Kirby) and continuous control tasks (PointMaze, MetaWorld). RTA consistently matches or outperforms prior video-based reward learning methods and rank-based baselines, while demonstrating strong cross-task reuse of a single pretrained progress scorer. Our results suggest that correlation-structured supervision over video-derived ordinal signals is sufficient for policy learning, offering a scalable alternative to explicit reward design.