ChatPaper.aiChatPaper

CapVector: Leren van overdraagbare vaardigheidsvectoren in parametrische ruimte voor visie-taal-actiemodellen

CapVector: Learning Transferable Capability Vectors in Parametric Space for Vision-Language-Action Models

May 11, 2026
Auteurs: Wenxuan Song, Han Zhao, Fuhao Li, Ziyang Zhou, Xi Wang, Jing Lyu, Pengxiang Ding, Yan Wang, Donglin Wang, Haoang Li
cs.AI

Samenvatting

Dit artikel stelt een nieuwe aanpak voor om het probleem aan te pakken dat voorgetrainde VLA-modellen vaak niet in staat zijn om de prestaties effectief te verbeteren en aanpassingskosten te verlagen tijdens standaard gesuperviseerd finetunen (SFT). Sommige geavanceerde finetuningsmethoden met aanvullende trainingsdoelstellingen kunnen de prestaties verbeteren en het aantal convergentiestappen verminderen. Ze brengen echter doorgaans aanzienlijke rekenkundige overhead met zich mee vanwege de extra verliezen van deze hulpdoelstellingen. Om tegelijkertijd de verbeterde mogelijkheden van hulptraining te bereiken met de eenvoud van standaard SFT, ontkoppelen we de twee doelstellingen van hulpdoelstelling-SFT in de parameterruimte, namelijk het verbeteren van algemene capaciteiten en het aanpassen aan taakspecifieke actieverdelingen. Om dit doel te bereiken, hoeven we het model slechts te trainen tot convergentie op een kleinschalige takenverzameling met behulp van twee verschillende trainingsstrategieën, wat resulteert in twee gefinetunede modellen. Het parameterverschil tussen de twee modellen kan dan worden geïnterpreteerd als capaciteitsvectoren die worden geleverd door hulpdoelstellingen. Deze vectoren worden vervolgens samengevoegd met de voorgetrainde parameters om een in capaciteit verbeterd metamodel te vormen. Bovendien, wanneer standaard SFT wordt aangevuld met een lichtgewicht orthogonale regularisatieverlies, behaalt het samengevoegde model prestaties die vergelijkbaar zijn met die van met hulpdoelstellingen gefinetunede baselines, met een lagere rekenkundige overhead. Interne en externe experimenten tonen aan dat onze capaciteitsvectoren (1) effectief en veelzijdig zijn bij diverse modellen, (2) uit de doos kunnen generaliseren naar nieuwe omgevingen en belichamingen.
English
This paper proposes a novel approach to address the challenge that pretrained VLA models often fail to effectively improve performance and reduce adaptation costs during standard supervised finetuning (SFT). Some advanced finetuning methods with auxiliary training objectives can improve performance and reduce the number of convergence steps. However, they typically incur significant computational overhead due to the additional losses from auxiliary objectives. To simultaneously achieve the enhanced capabilities of auxiliary training with the simplicity of standard SFT, we decouple the two objectives of auxiliary-objective SFT within the parameter space, namely, enhancing general capabilities and fitting task-specific action distributions. To deliver the goal, we only need to train the model to converge on a small-scale task set using two distinct training strategies, resulting in two finetuned models. The parameters' difference between the two models can then be interpreted as capability vectors provided by auxiliary objectives. These vectors are then merged with pretrained parameters to form a capability-enhanced meta model. Moreover, when standard SFT is augmented with a lightweight orthogonal regularization loss, the merged model attains performance comparable to auxiliary finetuned baselines with reduced computational overhead. Internal and external experiments demonstrate that our capability vectors (1) are effective and versatile across diverse models, (2) can generalize to novel environments and embodiments out of the box.