ChatPaper.aiChatPaper

SIEVE : Sélection de données sensible à la structure pour l'apprentissage par imitation avec des modèles VLA

SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models

July 7, 2026
Auteurs: Changti Wu, Bin Yu, Zhaolong Shen, Shijie Lian, Xiaopeng Lin, Cong Huang, Zhirui Zhang, Lei Zhang, Kai Chen
cs.AI

Résumé

Les modèles Vision-Langage-Action (VLA) sont généralement entraînés par apprentissage par imitation sur des ensembles de données de démonstrations robotiques à grande échelle, mais davantage de données ne conduit pas nécessairement à de meilleures politiques en raison de la redondance, du bruit et d'une couverture inégale. Les méthodes existantes de sélection de données évaluent souvent les démonstrations soit au niveau de la trajectoire, soit au niveau état-action, manquant ainsi les structures réutilisables qui composent les comportements à long terme. Dans cet article, nous proposons SIEVE, une méthode de sélection de données sensible à la structure pour l'apprentissage par imitation VLA. SIEVE considère les démonstrations comme des compositions de primitives réutilisables et d'interfaces de transition. Elle découvre d'abord les primitives visuo-motrices à partir de trajectoires segmentées, puis alloue des budgets de sélection aux schémas de composition en maximisant l'exposition structurelle tenant compte de la réutilisabilité sous des rendements décroissants. Enfin, elle sélectionne les trajectoires médoïdes au sein de chaque groupe de schémas de composition afin de conserver des démonstrations centrales, stables et favorables à l'imitation. Des expériences menées sur plusieurs ensembles de données, bancs d'essai et modèles VLA montrent que SIEVE surpasse systématiquement les références concurrentes de sélection de données. Notamment, SIEVE peut surpasser un entraînement sur l'ensemble des données tout en utilisant seulement 50 % des démonstrations et 50 % des étapes d'entraînement, ce qui suggère que la structure réutilisable, capturée par les primitives et les transitions, constitue un signal important pour un apprentissage par imitation VLA efficace.
English
Vision-Language-Action (VLA) models are typically trained by imitation learning on large-scale robot demonstration datasets, but more data does not necessarily yield better policies due to redundancy, noise, and uneven coverage. Existing data selection methods often assess demonstrations at either the trajectory or state-action level, missing the reusable structures that compose long-horizon behaviors. In this paper, we propose SIEVE, a structure-aware data selection method for VLA imitation learning. SIEVE views demonstrations as compositions of reusable primitives and transition interfaces. It first discovers visuo-motor primitives from segmented trajectories, then allocates selection budgets to composition patterns by maximizing reuse-aware structural exposure under diminishing returns. Finally, it selects medoid trajectories within each composition-pattern bucket to retain central, stable, and imitation-friendly demonstrations. Experiments across multiple datasets, benchmarks, and VLA models show that SIEVE consistently outperforms competitive data selection baselines. Notably, SIEVE can surpass full-data training while using only 50% of demonstrations and 50% of training steps, suggesting that reusable structure, captured through primitives and transitions, is an important signal for efficient VLA imitation learning.