Bezint eer ge begint: het destilleren van boomzoeken naar actie-evaluatie voor bevroren VLA-modellen
Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models
July 4, 2026
Auteurs: Xinyi Xie, Zican Hu, Zhanyu Liu, Yicheng Dong, Wenhao Wu, Zhenhong Sun, Haoran Li, Chunlin Chen, Zhi Wang, Pichao Wang
cs.AI
Samenvatting
Visie-Taal-Actie (VTA)-modellen verwerven brede belichaamde vaardigheden door middel van grootschalige pretraining, maar hun generalisatie blijft veel kwetsbaarder dan die van LLM's en VLM's. De gangbare remedie, nabewerking via gesuperviseerde fijnafstemming of bekrachtigingsleren, verbetert taakspecifieke prestaties, maar vernauwt de generalistische capaciteit die pretraining waardevol maakt. We identificeren een cruciaal knelpunt: VTA-fouten komen niet alleen voort uit actiegeneratie, maar ook uit actie-evaluatie. Een diagnostische pass@k-studie bevestigt dat bevroren VTA's al competente gedragingen in hun outputdistributie bevatten, waarbij totale slagingspercentages stijgen van 33% bij pass@1 naar 92% bij pass@32. Hieruit geïnspireerd stellen we SVA (Search, Value, and Act) voor, een eenvoudig raamwerk dat bevroren VTA-beleid voorziet van bewustzijn van langetermijngevolgen. SVA gebruikt eerst Monte-Carlo-boomzoeken in simulatie om de outputdistributie van de VTA volledig te verkennen en diverse trajecten te verzamelen die geannoteerd zijn met empirische opbrengsten; deze kennis wordt vervolgens gedestilleerd in een lichtgewicht Q-waardemodel dat de verwachte gevolgen van kandidaatacties voorspelt; bij implementatie stelt de bevroren VTA meerdere kandidaten voor en selecteert de evaluator degene met de hoogste onzekerheidsgeregulariseerde Q-waarde, zonder dat er een simulator nodig is. Door actievoorstel te ontkoppelen van gevolgevaluatie behoudt SVA de generalisatiecapaciteit van de VTA-backbone, terwijl taaksuccespercentages aanzienlijk verbeteren. Experimenten met belichaamde benchmarks tonen aan dat SVA consistent generalisatie naar onbekende taken verbetert en een sterk testtijdschaalgedrag vertoont. Opvallend is dat SVA een 9B VTA in staat stelt een 27B VTA te overtreffen met 7 punten bij 27% lagere inferentielatentie, wat suggereert dat het opschalen van testtijdsevaluatie kosteneffectiever is dan het opschalen van modelgrootte.
English
Vision-Language-Action (VLA) models acquire broad embodied capabilities through large-scale pretraining, yet their generalization remains far more fragile than that of LLMs and VLMs. The prevailing remedy, post-training via supervised fine-tuning or reinforcement learning, improves task-specific performance but narrows the generalist capability that makes pretraining valuable. We identify a key bottleneck: VLA failures stem not only from action generation but also from action evaluation. A diagnostic pass@k study confirms that frozen VLAs already contain competent behaviors in their output distribution, with overall success rates rising from 33% at pass@1 to 92% at pass@32. Inspired by this, we propose SVA (Search, Value, and Act), a simple framework that equips frozen VLA policies with long-term consequence awareness. SVA first uses Monte-Carlo tree search in simulation to fully explore the VLA's output distribution and collect diverse trajectories annotated with empirical returns; this knowledge is then distilled into a lightweight Q-value model that predicts the expected consequence of candidate actions; at deployment, the frozen VLA proposes multiple candidates and the evaluator selects the one with the highest uncertainty-regularized Q-value, requiring no simulator access. By decoupling action proposal from consequence evaluation, SVA preserves the generalization capacity of the VLA backbone while substantially improving task success rates. Experiments across embodied benchmarks show that SVA consistently improves generalization on unseen tasks and exhibits strong test-time scaling behavior. Strikingly, SVA enables a 9B VLA to outperform a 27B VLA by 7 points at 27% lower inference latency, suggesting that scaling test-time evaluation is more cost-effective than scaling model size.