ChatPaper.aiChatPaper

SIEVE: Seleção de Dados Sensível à Estrutura para Aprendizagem por Imitação com Modelos VLA

SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models

July 7, 2026
Autores: Changti Wu, Bin Yu, Zhaolong Shen, Shijie Lian, Xiaopeng Lin, Cong Huang, Zhirui Zhang, Lei Zhang, Kai Chen
cs.AI

Resumo

Modelos Visão-Linguagem-Ação (VLA) são tipicamente treinados por aprendizado por imitação em grandes conjuntos de dados de demonstrações robóticas, mas mais dados não necessariamente geram políticas melhores devido a redundância, ruído e cobertura desigual. Métodos existentes de seleção de dados frequentemente avaliam demonstrações no nível de trajetória ou estado-ação, perdendo as estruturas reutilizáveis que compõem comportamentos de longo horizonte. Neste artigo, propomos o SIEVE, um método de seleção de dados ciente da estrutura para aprendizado por imitação em VLA. O SIEVE vê as demonstrações como composições de primitivas reutilizáveis e interfaces de transição. Primeiro, ele descobre primitivas visuomotoras a partir de trajetórias segmentadas, depois aloca orçamentos de seleção a padrões de composição maximizando a exposição estrutural ciente de reutilização sob retornos decrescentes. Finalmente, seleciona trajetórias medoides dentro de cada categoria de padrão de composição para reter demonstrações centrais, estáveis e favoráveis à imitação. Experimentos em múltiplos conjuntos de dados, benchmarks e modelos VLA mostram que o SIEVE supera consistentemente linhas de base competitivas de seleção de dados. Notavelmente, o SIEVE pode superar o treinamento com dados completos usando apenas 50% das demonstrações e 50% das etapas de treinamento, sugerindo que a estrutura reutilizável, capturada por meio de primitivas e transições, é um sinal importante para o aprendizado eficiente por imitação em VLA.
English
Vision-Language-Action (VLA) models are typically trained by imitation learning on large-scale robot demonstration datasets, but more data does not necessarily yield better policies due to redundancy, noise, and uneven coverage. Existing data selection methods often assess demonstrations at either the trajectory or state-action level, missing the reusable structures that compose long-horizon behaviors. In this paper, we propose SIEVE, a structure-aware data selection method for VLA imitation learning. SIEVE views demonstrations as compositions of reusable primitives and transition interfaces. It first discovers visuo-motor primitives from segmented trajectories, then allocates selection budgets to composition patterns by maximizing reuse-aware structural exposure under diminishing returns. Finally, it selects medoid trajectories within each composition-pattern bucket to retain central, stable, and imitation-friendly demonstrations. Experiments across multiple datasets, benchmarks, and VLA models show that SIEVE consistently outperforms competitive data selection baselines. Notably, SIEVE can surpass full-data training while using only 50% of demonstrations and 50% of training steps, suggesting that reusable structure, captured through primitives and transitions, is an important signal for efficient VLA imitation learning.