CapVector : Apprentissage de vecteurs de capacité transférables dans l'espace paramétrique pour les modèles vision-langage-action
CapVector: Learning Transferable Capability Vectors in Parametric Space for Vision-Language-Action Models
May 11, 2026
Auteurs: Wenxuan Song, Han Zhao, Fuhao Li, Ziyang Zhou, Xi Wang, Jing Lyu, Pengxiang Ding, Yan Wang, Donglin Wang, Haoang Li
cs.AI
Résumé
Cet article propose une nouvelle approche pour résoudre le défi selon lequel les modèles VLA pré-entraînés échouent souvent à améliorer efficacement les performances et à réduire les coûts d'adaptation lors du réglage fin supervisé standard (SFT). Certaines méthodes avancées de réglage fin avec objectifs d'entraînement auxiliaires peuvent améliorer les performances et réduire le nombre d'étapes de convergence. Cependant, elles entraînent généralement une surcharge computationnelle importante due aux pertes supplémentaires liées aux objectifs auxiliaires. Pour concilier à la fois les capacités améliorées de l'entraînement auxiliaire et la simplicité du SFT standard, nous découplons les deux objectifs du SFT avec objectifs auxiliaires dans l'espace des paramètres, à savoir l'amélioration des capacités générales et l'ajustement des distributions d'actions spécifiques à la tâche. Pour atteindre cet objectif, il suffit d'entraîner le modèle à converger sur un ensemble de tâches à petite échelle en utilisant deux stratégies d'entraînement distinctes, ce qui donne deux modèles affinés. La différence des paramètres entre ces deux modèles peut alors être interprétée comme des vecteurs de capacité fournis par les objectifs auxiliaires. Ces vecteurs sont ensuite fusionnés avec les paramètres pré-entraînés pour former un méta-modèle aux capacités renforcées. De plus, lorsque le SFT standard est augmenté d'une perte de régularisation orthogonale légère, le modèle fusionné atteint des performances comparables aux bases de référence affinées avec objectifs auxiliaires, tout en réduisant la surcharge computationnelle. Les expériences internes et externes démontrent que nos vecteurs de capacité (1) sont efficaces et polyvalents pour divers modèles, (2) peuvent généraliser à de nouveaux environnements et incarnations sans adaptation préalable.
English
This paper proposes a novel approach to address the challenge that pretrained VLA models often fail to effectively improve performance and reduce adaptation costs during standard supervised finetuning (SFT). Some advanced finetuning methods with auxiliary training objectives can improve performance and reduce the number of convergence steps. However, they typically incur significant computational overhead due to the additional losses from auxiliary objectives. To simultaneously achieve the enhanced capabilities of auxiliary training with the simplicity of standard SFT, we decouple the two objectives of auxiliary-objective SFT within the parameter space, namely, enhancing general capabilities and fitting task-specific action distributions. To deliver the goal, we only need to train the model to converge on a small-scale task set using two distinct training strategies, resulting in two finetuned models. The parameters' difference between the two models can then be interpreted as capability vectors provided by auxiliary objectives. These vectors are then merged with pretrained parameters to form a capability-enhanced meta model. Moreover, when standard SFT is augmented with a lightweight orthogonal regularization loss, the merged model attains performance comparable to auxiliary finetuned baselines with reduced computational overhead. Internal and external experiments demonstrate that our capability vectors (1) are effective and versatile across diverse models, (2) can generalize to novel environments and embodiments out of the box.