ChatPaper.aiChatPaper

VLA-Corrector: Lichtgewicht detectie-en-correctie-inferentie voor adaptieve actiehorizon

VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon

July 2, 2026
Auteurs: Yi Pan, Miao Pan, Qi Lu, Jiaming Huang, Man Zhang, Siteng Huang, Xin Li, Jie Zhang, Yongliang Shen, Xuhong Zhang, Wenqi Zhang
cs.AI

Samenvatting

Visie-Taal-Actie (VTA)-fundamentmodellen hebben recentelijk sterke vooruitgang geboekt in belichaamde intelligentie. Om de frequentie van beleidsaanroepen te verlagen en tegelijkertijd temporele coherentie te behouden, hanteren de meeste generatieve beleidsvormen een actiechunkmechanisme, waarbij meerdere toekomstige acties op een open-lusmanier worden uitgevoerd binnen een vaste actiehorizon. Dit 'voorspel-en-voer-blindelings-uit'-paradigma offert echter de gesloten-lusreactiviteit op: bij contactrijke fysieke interacties kunnen zelfs kleine lokale verstoringen snel escaleren binnen de blinde vlek van de open lus, wat leidt tot cumulatieve fouten en uiteindelijk taakfalen. Om deze beperking aan te pakken, stellen we VLA-Corrector voor, een lichtgewicht corrigerend inferentiekader voor actiechunk-VTA-beleid. Zonder de gewichten van het onderliggende beleid aan te passen, introduceert VLA-Corrector een lichtgewicht Latente-ruimte Visie Monitor (LVM) die continu de voorspelde en werkelijke visuele kenmerkontwikkeling vergelijkt, waardoor online detectie van afwijkingen in de visuele dynamiek mogelijk wordt. Zodra een aanhoudende afwijking wordt gedetecteerd, activeert het systeem een truncatiegebeurtenis, verwijdert de resterende verouderde acties en roept corrigerende herplanning op via Online Gradient Guidance (OGG). Het detecteer-en-corrigeer-mechanisme van VLA-Corrector leidt van nature tot een gebeurtenisgestuurde adaptieve actiehorizon: het behoudt lange-horizonuitvoering zolang de huidige chunk betrouwbaar blijft, en roept korte-horizon corrigerende herplanning op wanneer de uitvoering begint af te wijken. Op deze manier vermindert VLA-Corrector de afweging die wordt opgelegd door statische horizons tussen uitvoeringsrobuustheid en beleidsaanroepfrequentie. Het kan worden geïntegreerd in verschillende VTA-modellen zonder verdere hertraining van de VTA-backbone, waardoor cumulatieve fouten worden onderbroken terwijl veel van de efficiëntievoordelen van actiechunking behouden blijven en de robuustheid in lange-horizon, contactrijke robotmanipulatietaken aanzienlijk wordt verbeterd.
English
Vision-Language-Action (VLA) foundation models have recently achieved strong progress in embodied intelligence. To reduce policy-call frequency while preserving temporal coherence, most generative policies adopt an action chunk mechanism, executing multiple future actions in an open-loop manner under a fixed action horizon. However, this "predict-then-blindly-execute" paradigm sacrifices closed-loop reactivity: in contact-rich physical interactions, even small local perturbations can rapidly amplify within the open-loop blind spot, leading to compounding errors and ultimately task failure. To address this limitation, we propose VLA-Corrector, a lightweight corrective inference framework for action-chunked VLA policies. Without modifying the backbone policy weights, VLA-Corrector introduces a lightweight Latent-space Vision Monitor (LVM) that continuously compares predicted and actual visual feature evolution, enabling online detection of visual dynamics deviations. Once persistent deviation is detected, the system triggers a truncation event, discards the remaining stale actions, and invokes corrective replanning via Online Gradient Guidance (OGG). The detect-and-correct mechanism of VLA-Corrector naturally induces an event-triggered adaptive action horizon: it preserves long-horizon execution when the current chunk remains reliable, and invokes short-horizon corrective replanning when execution begins to drift. In doing so, VLA-Corrector mitigates the trade-off imposed by static horizons between execution robustness and policy-call frequency. It can be integrated into different VLA models without further retraining the VLA backbone, interrupting compounding errors while preserving much of the efficiency benefit of action chunking and substantially improving robustness in long-horizon, contact-rich robotic manipulation tasks.