SIEVE: Structuurbewuste Dataselectie voor Imitatie Leren met VLA-Modellen
SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models
July 7, 2026
Auteurs: Changti Wu, Bin Yu, Zhaolong Shen, Shijie Lian, Xiaopeng Lin, Cong Huang, Zhirui Zhang, Lei Zhang, Kai Chen
cs.AI
Samenvatting
Visie-Taal-Actie (VLA) modellen worden doorgaans getraind door imitatieleren op grootschalige robotdemonstratiedatasets, maar meer data leidt niet noodzakelijk tot betere beleidsstrategieën vanwege redundantie, ruis en ongelijke dekking. Bestaande methoden voor gegevensselectie beoordelen demonstraties vaak op het niveau van trajecten of toestand-actie, waarbij ze de herbruikbare structuren die langetermijngedragingen vormen, missen. In dit artikel stellen we SIEVE voor, een structuurbewuste gegevensselectiemethode voor VLA-imitatieleren. SIEVE beschouwt demonstraties als composities van herbruikbare primitieven en overgangsinterfaces. Het ontdekt eerst visuomotorische primitieven uit gesegmenteerde trajecten, wijst vervolgens selectiebudgetten toe aan compositiepatronen door het maximaliseren van herbruikbaarheidsbewuste structurele blootstelling onder afnemende meeropbrengsten. Ten slotte selecteert het medoïde trajecten binnen elke op compositiepatroon gebaseerde groep om centrale, stabiele en imitatievriendelijke demonstraties te behouden. Experimenten met meerdere datasets, benchmarks en VLA-modellen tonen aan dat SIEVE consequent beter presteert dan concurrerende basislijnen voor gegevensselectie. Opmerkelijk is dat SIEVE volledige datatraining kan overtreffen terwijl het slechts 50% van de demonstraties en 50% van de trainingsstappen gebruikt, wat suggereert dat herbruikbare structuur, vastgelegd via primitieven en overgangen, een belangrijk signaal is voor efficiënt VLA-imitatieleren.
English
Vision-Language-Action (VLA) models are typically trained by imitation learning on large-scale robot demonstration datasets, but more data does not necessarily yield better policies due to redundancy, noise, and uneven coverage. Existing data selection methods often assess demonstrations at either the trajectory or state-action level, missing the reusable structures that compose long-horizon behaviors. In this paper, we propose SIEVE, a structure-aware data selection method for VLA imitation learning. SIEVE views demonstrations as compositions of reusable primitives and transition interfaces. It first discovers visuo-motor primitives from segmented trajectories, then allocates selection budgets to composition patterns by maximizing reuse-aware structural exposure under diminishing returns. Finally, it selects medoid trajectories within each composition-pattern bucket to retain central, stable, and imitation-friendly demonstrations. Experiments across multiple datasets, benchmarks, and VLA models show that SIEVE consistently outperforms competitive data selection baselines. Notably, SIEVE can surpass full-data training while using only 50% of demonstrations and 50% of training steps, suggesting that reusable structure, captured through primitives and transitions, is an important signal for efficient VLA imitation learning.