Regardez avant de sauter : distillation de la recherche arborescente en évaluation d'actions pour des modèles VLA gelés
Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models
July 4, 2026
Auteurs: Xinyi Xie, Zican Hu, Zhanyu Liu, Yicheng Dong, Wenhao Wu, Zhenhong Sun, Haoran Li, Chunlin Chen, Zhi Wang, Pichao Wang
cs.AI
Résumé
Les modèles Vision-Langage-Action (VLA) acquièrent de vastes capacités incarnées grâce à un pré-entraînement à grande échelle, mais leur généralisation reste bien plus fragile que celle des LLMs et des VLMs. Le remède courant, le post-entraînement par fine-tuning supervisé ou apprentissage par renforcement, améliore les performances spécifiques aux tâches mais réduit la capacité généraliste qui rend le pré-entraînement précieux. Nous identifions un goulot d'étranglement clé : les échecs des VLA proviennent non seulement de la génération d'actions mais aussi de l'évaluation des actions. Une étude diagnostique pass@k confirme que les VLA gelés contiennent déjà des comportements compétents dans leur distribution de sortie, avec des taux de succès globaux passant de 33 % à pass@1 à 92 % à pass@32. Inspirés par cela, nous proposons SVA (Search, Value, and Act), un cadre simple qui dote les politiques VLA gelées d'une conscience des conséquences à long terme. SVA utilise d'abord la recherche arborescente de Monte-Carlo en simulation pour explorer pleinement la distribution de sortie du VLA et collecter des trajectoires diverses annotées avec des retours empiriques ; cette connaissance est ensuite distillée dans un modèle de valeur Q léger qui prédit la conséquence attendue des actions candidates ; lors du déploiement, le VLA gelé propose plusieurs candidats et l'évaluateur sélectionne celui avec la valeur Q régularisée par l'incertitude la plus élevée, sans nécessiter d'accès au simulateur. En découplant la proposition d'action de l'évaluation des conséquences, SVA préserve la capacité de généralisation de l'architecture de base du VLA tout en améliorant considérablement les taux de réussite des tâches. Des expériences sur des benchmarks incarnés montrent que SVA améliore systématiquement la généralisation sur des tâches non vues et présente un fort comportement de passage à l'échelle au moment du test. Fait frappant, SVA permet à un VLA de 9B de surpasser un VLA de 27B de 7 points avec une latence d'inférence 27 % inférieure, ce qui suggère que le passage à l'échelle de l'évaluation au moment du test est plus rentable que le passage à l'échelle de la taille du modèle.
English
Vision-Language-Action (VLA) models acquire broad embodied capabilities through large-scale pretraining, yet their generalization remains far more fragile than that of LLMs and VLMs. The prevailing remedy, post-training via supervised fine-tuning or reinforcement learning, improves task-specific performance but narrows the generalist capability that makes pretraining valuable. We identify a key bottleneck: VLA failures stem not only from action generation but also from action evaluation. A diagnostic pass@k study confirms that frozen VLAs already contain competent behaviors in their output distribution, with overall success rates rising from 33% at pass@1 to 92% at pass@32. Inspired by this, we propose SVA (Search, Value, and Act), a simple framework that equips frozen VLA policies with long-term consequence awareness. SVA first uses Monte-Carlo tree search in simulation to fully explore the VLA's output distribution and collect diverse trajectories annotated with empirical returns; this knowledge is then distilled into a lightweight Q-value model that predicts the expected consequence of candidate actions; at deployment, the frozen VLA proposes multiple candidates and the evaluator selects the one with the highest uncertainty-regularized Q-value, requiring no simulator access. By decoupling action proposal from consequence evaluation, SVA preserves the generalization capacity of the VLA backbone while substantially improving task success rates. Experiments across embodied benchmarks show that SVA consistently improves generalization on unseen tasks and exhibits strong test-time scaling behavior. Strikingly, SVA enables a 9B VLA to outperform a 27B VLA by 7 points at 27% lower inference latency, suggesting that scaling test-time evaluation is more cost-effective than scaling model size.