ChatPaper.aiChatPaper

PolicyTrim: Melhorando a Eficiência Intrínseca da Política de Modelos Visão-Linguagem-Ação

PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models

June 21, 2026
Autores: Xianghui Wang, Feng Chen, Wenbo Zhang, Hua Yan, Zixuan Wang, Changsheng Li, Yinjie Lei
cs.AI

Resumo

Modelos Visão-Linguagem-Ação (VLA) fornecem um paradigma unificado para manipulação robótica, porém sua implementação no mundo real é frequentemente limitada pela eficiência de execução. Embora os esforços existentes se concentrem predominantemente na eficiência centrada em computação para reduzir a latência de inferência por etapa, a eficiência política intrínseca desses modelos permanece amplamente inexplorada. A eficiência política é fundamentalmente afetada por dois fatores: o comprimento executável efetivo dos blocos de ação previstos e o total de etapas físicas necessárias para concluir uma tarefa. Esses dois fatores determinam conjuntamente o número total de chamadas de inferência direta durante a execução. Observamos que as políticas VLA atuais enfrentam problemas de falta de confiabilidade no planejamento e redundância de ações, sofrendo com degradações severas na previsão no final dos blocos de ação e tendendo a gerar etapas físicas desnecessariamente redundantes. Para resolver isso, propomos o PolicyTrim, um framework de pós-treinamento baseado em aprendizado por reforço que estende o comprimento confiável dos blocos de ação e reduz as etapas físicas redundantes. Para a extensão confiável de blocos, empregamos uma estratégia de exploração dinâmica que recompensa explicitamente a conclusão bem-sucedida de comprimentos executáveis mais longos, gradualmente ampliando o horizonte de previsão confiável até seu limite empírico. Para a eficiência das etapas, projetamos uma recompensa sensível à redundância que favorece diretamente conclusões bem-sucedidas de tarefas com menos etapas, enquanto penaliza atalhos não reproduzíveis, eliminando efetivamente ações físicas redundantes. Experimentos extensivos em três benchmarks e três modelos VLA demonstram que o PolicyTrim melhora a utilização de blocos de ação em 3 vezes e reduz as etapas de execução física em 51,4%. Por fim, nosso framework proporciona uma aceleração de implantação ponta a ponta de até 5,83 vezes, sem comprometer as taxas de sucesso das tarefas.
English
Vision-Language-Action (VLA) models provide a unified paradigm for robotic manipulation, yet their real-world deployment is often bottlenecked by execution efficiency. While existing efforts predominantly focus on compute-centric efficiency to reduce per-step inference latency, the intrinsic policy efficiency of these models remains largely unexplored. Policy efficiency is fundamentally affected by two factors, namely the effective executable length of predicted action chunks and the total physical steps required to complete a task. These two factors jointly determine the total number of forward inference calls during execution. We observe that current VLA policies struggle with planning unreliability and action redundancy, suffering from severe prediction degradation at the tail of action chunks and tending to generate unnecessarily redundant physical steps. To address this, we propose PolicyTrim, a reinforcement learning-based post-training framework that extends the reliable action chunk length and reduces redundant physical steps. For reliable chunk extension, we employ a dynamic exploration strategy that explicitly rewards the successful completion of longer executable lengths, progressively pushing the trustworthy prediction horizon to its empirical limit. For step efficiency, we design a redundancy-aware reward that directly favors successful task completions with fewer steps while penalizing unreproducible shortcuts, effectively eliminating redundant physical actions. Extensive experiments across three benchmarks and three VLA models demonstrate that PolicyTrim improves action chunk utilization by 3times and reduces physical execution steps by 51.4\%. Ultimately, our framework delivers up to a 5.83times end-to-end deployment speedup without compromising task success rates.