ChatPaper.aiChatPaper

Domeinrekenkunde: Eenmalige VLA-Adaptatie onder Omgevingsverschuivingen

Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts

July 1, 2026
Auteurs: Taewook Kang, Taeheon Kim, Donghyun Shin, Jonghyun Choi
cs.AI

Samenvatting

Visie-Taal-Actie (VLA) modellen falen vaak bij het uitvoeren van dezelfde aangeleerde taken onder omgevingsverschuivingen, zoals veranderingen in camerapositie en overstappen naar een andere maar vergelijkbare robot (bijv. van Panda naar UR5e). Het aanpassen van deze modellen aan de verschoven omgeving (het doeldomein) vereist doorgaans training op meerdere demonstraties per taak, wat kostbaar is om te verzamelen. Om de last van datacuratie en training te verminderen, stellen we een op analogie gebaseerde methode voor die VLA-modellen aanpast onder omgevingsverschuivingen door middel van gewichtsvectorrekenkunde met toevoeging van domeinspecifieke informatie, genaamd Domain ARiThmetic (DART). In tegenstelling tot eerdere benaderingen vereist DART slechts het verzamelen van één demonstratie, wat efficiënte aanpassing mogelijk maakt. Om domeinspecifieke informatie nauwkeurig te isoleren voor toevoeging, voert DART subruimte-uitlijning uit tussen singuliere componenten in gewichtsvectoren om ruiscomponenten weg te filteren. In zowel gesimuleerde als echte experimenten presteert DART beter dan bestaande VLA-aanpassingsmethoden in éénmalige scenario's bij diverse visuele en belichamingsverschuivingen. Code is beschikbaar op https://github.com/snumprlab/dart.
English
Vision-Language-Action (VLA) models often fail to perform the same learned tasks under environmental shifts, such as changes in camera pose and shifts to a different but similar robot (e.g., from Panda to UR5e). Adapting these models to the shifted environment (i.e., target domain) often requires training on multiple demonstrations for each task, which are costly to collect. To reduce the burden of data curation and training, we propose an analogy-based method that adapts VLA models under environmental shifts through weight vector arithmetic with domain-specific information addition, named Domain ARiThmetic (DART). Unlike prior approaches, DART requires collecting only a single demonstration, enabling efficient adaptation. To accurately isolate domain-specific information for addition, DART performs subspace alignment between singular components in weight vectors to filter out noisy components. In both simulated and real-world experiments, DART outperforms existing VLA adaptation methods in one-shot scenarios across diverse visual and embodiment shifts. Code is available at https://github.com/snumprlab/dart.