SIEVE: Selección de Datos Consciente de la Estructura para Aprendizaje por Imitación con Modelos VLA
SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models
July 7, 2026
Autores: Changti Wu, Bin Yu, Zhaolong Shen, Shijie Lian, Xiaopeng Lin, Cong Huang, Zhirui Zhang, Lei Zhang, Kai Chen
cs.AI
Resumen
Los modelos Visión-Lenguaje-Acción (VLA) suelen entrenarse mediante aprendizaje por imitación con conjuntos de datos robóticos de demostraciones a gran escala, pero un mayor volumen de datos no necesariamente produce políticas mejores debido a la redundancia, el ruido y una cobertura desigual. Los métodos existentes de selección de datos a menudo evalúan las demostraciones ya sea a nivel de trayectoria o de estado-acción, pasando por alto las estructuras reutilizables que componen comportamientos de largo horizonte. En este artículo, proponemos SIEVE, un método de selección de datos sensible a la estructura para el aprendizaje por imitación con VLA. SIEVE concibe las demostraciones como composiciones de primitivas reutilizables e interfaces de transición. Primero descubre primitivas visomotoras a partir de trayectorias segmentadas, luego asigna presupuestos de selección a patrones de composición maximizando la exposición estructural consciente de la reutilización bajo rendimientos decrecientes. Finalmente, selecciona trayectorias medoides dentro de cada grupo de patrones de composición para retener demostraciones centrales, estables y favorables a la imitación. Experimentos realizados en múltiples conjuntos de datos, puntos de referencia y modelos VLA muestran que SIEVE supera consistentemente a las líneas base competitivas de selección de datos. En particular, SIEVE puede superar el entrenamiento con todos los datos utilizando solo el 50% de las demostraciones y el 50% de los pasos de entrenamiento, lo que sugiere que la estructura reutilizable, capturada a través de primitivas y transiciones, es una señal importante para el aprendizaje eficiente por imitación con VLA.
English
Vision-Language-Action (VLA) models are typically trained by imitation learning on large-scale robot demonstration datasets, but more data does not necessarily yield better policies due to redundancy, noise, and uneven coverage. Existing data selection methods often assess demonstrations at either the trajectory or state-action level, missing the reusable structures that compose long-horizon behaviors. In this paper, we propose SIEVE, a structure-aware data selection method for VLA imitation learning. SIEVE views demonstrations as compositions of reusable primitives and transition interfaces. It first discovers visuo-motor primitives from segmented trajectories, then allocates selection budgets to composition patterns by maximizing reuse-aware structural exposure under diminishing returns. Finally, it selects medoid trajectories within each composition-pattern bucket to retain central, stable, and imitation-friendly demonstrations. Experiments across multiple datasets, benchmarks, and VLA models show that SIEVE consistently outperforms competitive data selection baselines. Notably, SIEVE can surpass full-data training while using only 50% of demonstrations and 50% of training steps, suggesting that reusable structure, captured through primitives and transitions, is an important signal for efficient VLA imitation learning.