CapVector: Aprendendo Vetores de Capacidade Transferíveis no Espaço Paramétrico para Modelos Visão-Linguagem-Ação
CapVector: Learning Transferable Capability Vectors in Parametric Space for Vision-Language-Action Models
May 11, 2026
Autores: Wenxuan Song, Han Zhao, Fuhao Li, Ziyang Zhou, Xi Wang, Jing Lyu, Pengxiang Ding, Yan Wang, Donglin Wang, Haoang Li
cs.AI
Resumo
Este artigo propõe uma abordagem inovadora para enfrentar o desafio de que modelos VLA pré-treinados frequentemente não conseguem melhorar eficazmente o desempenho e reduzir os custos de adaptação durante o ajuste fino supervisionado padrão (SFT). Alguns métodos avançados de ajuste fino com objetivos auxiliares de treinamento podem melhorar o desempenho e reduzir o número de etapas de convergência. No entanto, eles geralmente incorrem em significativa sobrecarga computacional devido às perdas adicionais dos objetivos auxiliares. Para alcançar simultaneamente as capacidades aprimoradas do treinamento auxiliar com a simplicidade do SFT padrão, desacoplamos os dois objetivos do SFT com objetivo auxiliar dentro do espaço de parâmetros, a saber: melhorar capacidades gerais e ajustar distribuições de ações específicas da tarefa. Para atingir esse objetivo, precisamos apenas treinar o modelo para convergir em um conjunto de tarefas de pequena escala usando duas estratégias distintas de treinamento, resultando em dois modelos ajustados. A diferença de parâmetros entre os dois modelos pode então ser interpretada como vetores de capacidade fornecidos pelos objetivos auxiliares. Esses vetores são então mesclados com os parâmetros pré-treinados para formar um meta-modelo com capacidade aprimorada. Além disso, quando o SFT padrão é aumentado com uma perda leve de regularização ortogonal, o modelo mesclado atinge desempenho comparável às linhas de base de ajuste fino auxiliar, com sobrecarga computacional reduzida. Experimentos internos e externos demonstram que nossos vetores de capacidade (1) são eficazes e versáteis em diversos modelos, (2) podem generalizar prontamente para novos ambientes e corporificações.
English
This paper proposes a novel approach to address the challenge that pretrained VLA models often fail to effectively improve performance and reduce adaptation costs during standard supervised finetuning (SFT). Some advanced finetuning methods with auxiliary training objectives can improve performance and reduce the number of convergence steps. However, they typically incur significant computational overhead due to the additional losses from auxiliary objectives. To simultaneously achieve the enhanced capabilities of auxiliary training with the simplicity of standard SFT, we decouple the two objectives of auxiliary-objective SFT within the parameter space, namely, enhancing general capabilities and fitting task-specific action distributions. To deliver the goal, we only need to train the model to converge on a small-scale task set using two distinct training strategies, resulting in two finetuned models. The parameters' difference between the two models can then be interpreted as capability vectors provided by auxiliary objectives. These vectors are then merged with pretrained parameters to form a capability-enhanced meta model. Moreover, when standard SFT is augmented with a lightweight orthogonal regularization loss, the merged model attains performance comparable to auxiliary finetuned baselines with reduced computational overhead. Internal and external experiments demonstrate that our capability vectors (1) are effective and versatile across diverse models, (2) can generalize to novel environments and embodiments out of the box.