SIEVE: Структурно-осознанный выбор данных для имитационного обучения с VLA моделями.
SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models
July 7, 2026
Авторы: Changti Wu, Bin Yu, Zhaolong Shen, Shijie Lian, Xiaopeng Lin, Cong Huang, Zhirui Zhang, Lei Zhang, Kai Chen
cs.AI
Аннотация
Модели Vision-Language-Action (VLA) обычно обучаются с помощью имитационного обучения на крупномасштабных наборах данных с демонстрациями роботов, однако увеличение объема данных не обязательно приводит к улучшению стратегий из-за избыточности, шума и неравномерного покрытия. Существующие методы выбора данных часто оценивают демонстрации на уровне траекторий или пар состояние-действие, упуская из виду повторно используемые структуры, из которых состоят долгосрочные поведения. В этой статье мы предлагаем SIEVE — метод структурно-осознанного выбора данных для имитационного обучения VLA. SIEVE рассматривает демонстрации как композиции повторно используемых примитивов и интерфейсов перехода. Сначала он обнаруживает визуомоторные примитивы из сегментированных траекторий, затем распределяет бюджеты выбора по шаблонам композиции, максимизируя структурную экспозицию с учетом повторного использования в условиях убывающей отдачи. Наконец, он выбирает траектории-медоиды в пределах каждого сегмента шаблона композиции, чтобы сохранить центральные, стабильные и благоприятные для имитации демонстрации. Эксперименты на нескольких наборах данных, бенчмарках и моделях VLA показывают, что SIEVE последовательно превосходит конкурирующие базовые методы выбора данных. Примечательно, что SIEVE может превзойти обучение на полных данных, используя лишь 50% демонстраций и 50% шагов обучения, что позволяет предположить, что повторно используемая структура, фиксируемая через примитивы и переходы, является важным сигналом для эффективного имитационного обучения VLA.
English
Vision-Language-Action (VLA) models are typically trained by imitation learning on large-scale robot demonstration datasets, but more data does not necessarily yield better policies due to redundancy, noise, and uneven coverage. Existing data selection methods often assess demonstrations at either the trajectory or state-action level, missing the reusable structures that compose long-horizon behaviors. In this paper, we propose SIEVE, a structure-aware data selection method for VLA imitation learning. SIEVE views demonstrations as compositions of reusable primitives and transition interfaces. It first discovers visuo-motor primitives from segmented trajectories, then allocates selection budgets to composition patterns by maximizing reuse-aware structural exposure under diminishing returns. Finally, it selects medoid trajectories within each composition-pattern bucket to retain central, stable, and imitation-friendly demonstrations. Experiments across multiple datasets, benchmarks, and VLA models show that SIEVE consistently outperforms competitive data selection baselines. Notably, SIEVE can surpass full-data training while using only 50% of demonstrations and 50% of training steps, suggesting that reusable structure, captured through primitives and transitions, is an important signal for efficient VLA imitation learning.