Посмотри, прежде чем прыгать: дистилляция поиска по дереву в оценку действий для замороженных VLA-моделей
Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models
July 4, 2026
Авторы: Xinyi Xie, Zican Hu, Zhanyu Liu, Yicheng Dong, Wenhao Wu, Zhenhong Sun, Haoran Li, Chunlin Chen, Zhi Wang, Pichao Wang
cs.AI
Аннотация
Модели «Видение–Язык–Действие» (VLA) приобретают широкие воплощенные способности благодаря крупномасштабному предварительному обучению, однако их обобщение остается гораздо более хрупким, чем у LLM и VLM. Распространенное средство — пост-обучение с помощью контролируемой тонкой настройки или обучения с подкреплением — улучшает производительность на конкретных задачах, но сужает способность к обобщению, которая делает предварительное обучение ценным. Мы выявляем ключевое узкое место: сбои VLA связаны не только с генерацией действий, но и с оценкой действий. Диагностическое исследование pass@k подтверждает, что замороженные VLA уже содержат компетентные поведения в своем выходном распределении, с общим уровнем успешности, возрастающим с 33% при pass@1 до 92% при pass@32. Вдохновленные этим, мы предлагаем SVA (Search, Value, and Act) — простую структуру, которая наделяет замороженные политики VLA осознанием долгосрочных последствий. SVA сначала использует поиск по дереву Монте-Карло в симуляции для полного исследования выходного распределения VLA и сбора разнообразных траекторий, аннотированных эмпирическими возвратами; затем эти знания дистиллируются в легковесную модель Q-значений, которая предсказывает ожидаемые последствия кандидатных действий; при развертывании замороженная VLA предлагает несколько кандидатов, а оценщик выбирает тот, который имеет наибольшее Q-значение с регуляризацией неопределенности, что не требует доступа к симулятору. Путем разделения предложения действий и оценки последствий SVA сохраняет обобщающую способность основы VLA, одновременно значительно повышая уровень успешности выполнения задач. Эксперименты на воплощенных бенчмарках показывают, что SVA последовательно улучшает обобщение на невидимых задачах и демонстрирует сильное масштабирование во время тестирования. Примечательно, что SVA позволяет VLA с 9 млрд параметров превзойти VLA с 27 млрд параметров на 7 пунктов при задержке вывода, меньшей на 27%, что предполагает, что масштабирование оценки во время тестирования более рентабельно, чем масштабирование размера модели.
English
Vision-Language-Action (VLA) models acquire broad embodied capabilities through large-scale pretraining, yet their generalization remains far more fragile than that of LLMs and VLMs. The prevailing remedy, post-training via supervised fine-tuning or reinforcement learning, improves task-specific performance but narrows the generalist capability that makes pretraining valuable. We identify a key bottleneck: VLA failures stem not only from action generation but also from action evaluation. A diagnostic pass@k study confirms that frozen VLAs already contain competent behaviors in their output distribution, with overall success rates rising from 33% at pass@1 to 92% at pass@32. Inspired by this, we propose SVA (Search, Value, and Act), a simple framework that equips frozen VLA policies with long-term consequence awareness. SVA first uses Monte-Carlo tree search in simulation to fully explore the VLA's output distribution and collect diverse trajectories annotated with empirical returns; this knowledge is then distilled into a lightweight Q-value model that predicts the expected consequence of candidate actions; at deployment, the frozen VLA proposes multiple candidates and the evaluator selects the one with the highest uncertainty-regularized Q-value, requiring no simulator access. By decoupling action proposal from consequence evaluation, SVA preserves the generalization capacity of the VLA backbone while substantially improving task success rates. Experiments across embodied benchmarks show that SVA consistently improves generalization on unseen tasks and exhibits strong test-time scaling behavior. Strikingly, SVA enables a 9B VLA to outperform a 27B VLA by 7 points at 27% lower inference latency, suggesting that scaling test-time evaluation is more cost-effective than scaling model size.