ChatPaper.aiChatPaper

Mira Antes de Saltar: Destilando la Búsqueda de Árbol en Evaluación de Acciones para Modelos VLA Congelados

Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models

July 4, 2026
Autores: Xinyi Xie, Zican Hu, Zhanyu Liu, Yicheng Dong, Wenhao Wu, Zhenhong Sun, Haoran Li, Chunlin Chen, Zhi Wang, Pichao Wang
cs.AI

Resumen

Los modelos Visión-Lenguaje-Acción (VLA) adquieren capacidades encarnadas amplias mediante preentrenamiento a gran escala, pero su generalización sigue siendo mucho más frágil que la de los LLM y VLM. El remedio habitual, el post-entrenamiento mediante ajuste fino supervisado o aprendizaje por refuerzo, mejora el rendimiento en tareas específicas, pero reduce la capacidad generalista que hace valioso el preentrenamiento. Identificamos un cuello de botella clave: los fallos de los VLA no solo se deben a la generación de acciones, sino también a la evaluación de estas. Un estudio diagnóstico pass@k confirma que los VLA congelados ya contienen comportamientos competentes en su distribución de salida, con tasas de éxito global que aumentan del 33% en pass@1 al 92% en pass@32. Inspirados por esto, proponemos SVA (Search, Value, and Act), un marco simple que dota a las políticas VLA congeladas de conciencia de consecuencias a largo plazo. SVA primero utiliza búsqueda de árbol de Monte-Carlo en simulación para explorar completamente la distribución de salida del VLA y recolectar diversas trayectorias anotadas con retornos empíricos; luego, este conocimiento se destila en un modelo de valor Q ligero que predice la consecuencia esperada de acciones candidatas; en el despliegue, el VLA congelado propone múltiples candidatos y el evaluador selecciona el de mayor valor Q regularizado por incertidumbre, sin necesidad de acceso al simulador. Al desacoplar la propuesta de acciones de la evaluación de consecuencias, SVA preserva la capacidad de generalización del backbone VLA mientras mejora sustancialmente las tasas de éxito en las tareas. Los experimentos en benchmarks encarnados muestran que SVA mejora consistentemente la generalización en tareas no vistas y exhibe un fuerte comportamiento de escalamiento en tiempo de inferencia. Sorprendentemente, SVA permite que un VLA de 9B supere a uno de 27B por 7 puntos con un 27% menos de latencia de inferencia, lo que sugiere que escalar la evaluación en tiempo de inferencia es más rentable que escalar el tamaño del modelo.
English
Vision-Language-Action (VLA) models acquire broad embodied capabilities through large-scale pretraining, yet their generalization remains far more fragile than that of LLMs and VLMs. The prevailing remedy, post-training via supervised fine-tuning or reinforcement learning, improves task-specific performance but narrows the generalist capability that makes pretraining valuable. We identify a key bottleneck: VLA failures stem not only from action generation but also from action evaluation. A diagnostic pass@k study confirms that frozen VLAs already contain competent behaviors in their output distribution, with overall success rates rising from 33% at pass@1 to 92% at pass@32. Inspired by this, we propose SVA (Search, Value, and Act), a simple framework that equips frozen VLA policies with long-term consequence awareness. SVA first uses Monte-Carlo tree search in simulation to fully explore the VLA's output distribution and collect diverse trajectories annotated with empirical returns; this knowledge is then distilled into a lightweight Q-value model that predicts the expected consequence of candidate actions; at deployment, the frozen VLA proposes multiple candidates and the evaluator selects the one with the highest uncertainty-regularized Q-value, requiring no simulator access. By decoupling action proposal from consequence evaluation, SVA preserves the generalization capacity of the VLA backbone while substantially improving task success rates. Experiments across embodied benchmarks show that SVA consistently improves generalization on unseen tasks and exhibits strong test-time scaling behavior. Strikingly, SVA enables a 9B VLA to outperform a 27B VLA by 7 points at 27% lower inference latency, suggesting that scaling test-time evaluation is more cost-effective than scaling model size.