ChatPaper.aiChatPaper

VLA-Corrector: Inferência Leve de Detecção e Correção para Horizonte de Ação Adaptativo

VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon

July 2, 2026
Autores: Yi Pan, Miao Pan, Qi Lu, Jiaming Huang, Man Zhang, Siteng Huang, Xin Li, Jie Zhang, Yongliang Shen, Xuhong Zhang, Wenqi Zhang
cs.AI

Resumo

Modelos fundamentais Visão-Linguagem-Ação (VLA) alcançaram recentemente um forte progresso em inteligência incorporada. Para reduzir a frequência de chamadas de política enquanto preservam a coerência temporal, a maioria das políticas generativas adota um mecanismo de chunk de ações, executando múltiplas ações futuras de forma open-loop sob um horizonte de ação fixo. No entanto, esse paradigma "prever-depois-executar-cegamente" sacrifica a reatividade em malha fechada: em interações físicas ricas em contato, mesmo pequenas perturbações locais podem amplificar-se rapidamente dentro do ponto cego do open-loop, levando a erros compostos e, em última análise, à falha da tarefa. Para lidar com essa limitação, propomos o VLA-Corrector, um framework de inferência corretiva leve para políticas VLA com chunk de ações. Sem modificar os pesos da política principal, o VLA-Corrector introduz um Monitor de Visão em Espaço Latente (LVM) leve que compara continuamente a evolução prevista e real das características visuais, permitindo a detecção online de desvios na dinâmica visual. Uma vez detectado um desvio persistente, o sistema aciona um evento de truncamento, descarta as ações restantes obsoletas e invoca um replanejamento corretivo via Orientação por Gradiente Online (OGG). O mecanismo de detectar-e-corrigir do VLA-Corrector induz naturalmente um horizonte de ação adaptativo acionado por eventos: ele preserva a execução de longo horizonte quando o chunk atual permanece confiável e invoca um replanejamento corretivo de curto horizonte quando a execução começa a se desviar. Ao fazer isso, o VLA-Corrector mitiga o trade-off imposto por horizontes estáticos entre robustez de execução e frequência de chamadas de política. Ele pode ser integrado em diferentes modelos VLA sem necessidade de retreinar a espinha dorsal do VLA, interrompendo erros compostos enquanto preserva grande parte do benefício de eficiência do chunk de ações e melhora substancialmente a robustez em tarefas de manipulação robótica de longo horizonte e ricas em contato.
English
Vision-Language-Action (VLA) foundation models have recently achieved strong progress in embodied intelligence. To reduce policy-call frequency while preserving temporal coherence, most generative policies adopt an action chunk mechanism, executing multiple future actions in an open-loop manner under a fixed action horizon. However, this "predict-then-blindly-execute" paradigm sacrifices closed-loop reactivity: in contact-rich physical interactions, even small local perturbations can rapidly amplify within the open-loop blind spot, leading to compounding errors and ultimately task failure. To address this limitation, we propose VLA-Corrector, a lightweight corrective inference framework for action-chunked VLA policies. Without modifying the backbone policy weights, VLA-Corrector introduces a lightweight Latent-space Vision Monitor (LVM) that continuously compares predicted and actual visual feature evolution, enabling online detection of visual dynamics deviations. Once persistent deviation is detected, the system triggers a truncation event, discards the remaining stale actions, and invokes corrective replanning via Online Gradient Guidance (OGG). The detect-and-correct mechanism of VLA-Corrector naturally induces an event-triggered adaptive action horizon: it preserves long-horizon execution when the current chunk remains reliable, and invokes short-horizon corrective replanning when execution begins to drift. In doing so, VLA-Corrector mitigates the trade-off imposed by static horizons between execution robustness and policy-call frequency. It can be integrated into different VLA models without further retraining the VLA backbone, interrupting compounding errors while preserving much of the efficiency benefit of action chunking and substantially improving robustness in long-horizon, contact-rich robotic manipulation tasks.