ChatPaper.aiChatPaper

AdaPreLoRA: Adaptação de Baixa Classificação Precondicionada por Adafactor

AdaPreLoRA: Adafactor Preconditioned Low-Rank Adaptation

May 9, 2026
Autores: Ziyun Liu, Fengmiao Bian, Jian-Feng Cai
cs.AI

Resumo

A Adaptação de Baixo Posto (LoRA) reparametriza uma atualização de pesos como um produto de dois fatores de baixo posto, mas o Jacobiano \( J_{G} \) do mapeamento gerador dos fatores para a matriz de pesos é deficiente em posto, de modo que o pré-condicionador no espaço de fatores \( J_{G}^* {F}_t J_{G} \) induzido por qualquer pré-condicionador \( {F}_t \) no espaço \( {W} \) é singular e, consequentemente, a regra da cadeia padrão não pode ser invertida de forma única para mapear uma direção pré-condicionada no espaço \( {W} \) de volta a uma atualização no espaço de fatores. Enquadramos os otimizadores LoRA existentes em uma estrutura unificada parametrizada por duas escolhas: (i) qual substituto inversível para \( J_{G}^* {F}_t J_{G} \) usar e (ii) qual \( {F}_t \) em \( {W} \) usar. Os métodos existentes ocupam quatro famílias ao longo desses eixos: atualizações adaptativas no espaço de fatores, substitutos bloco-diagonais para \( J_{G}^* J_{G} \), métodos de pseudoinversa de resíduo de Frobenius e restrição de variedade Riemanniana. Dentro desse espaço de projeto, um \( {F}_t \) consciente de estatísticas de gradiente, combinado com uma solução em forma fechada no espaço de fatores com memória \( {O}((m+n)r) \), permanece pouco explorado. Propomos AdaPreLoRA, que preenche essa lacuna ao adotar o pré-condicionador diagonal Kronecker do Adafactor \( {H}_t \) em \( {W} \) e selecionar da família de soluções no espaço de fatores resultante o elemento que minimiza um desequilíbrio ponderado por \( {H}_t \) entre as contribuições dos dois fatores; por construção, a atualização de fatores resultante é a aproximação LoRA mais próxima da direção pré-condicionada no espaço \( {W} \) sob a norma ponderada por \( {H}_t \). Em experimentos com GPT-2 (E2E), Mistral-7B e Qwen2-7B (GLUE, ARC, GSM8K) e personalização de modelo de difusão, AdaPreLoRA é competitivo ou melhora em relação a um conjunto representativo de otimizadores LoRA, mantendo o pico de memória GPU no nível do otimizador LoRA.
English
Low-Rank Adaptation (LoRA) reparameterizes a weight update as a product of two low-rank factors, but the Jacobian J_{G} of the generator mapping the factors to the weight matrix is rank-deficient, so the factor-space preconditioner J_{G}^* {F}_t J_{G} induced by any {W}-space preconditioner {F}_t is singular, and consequently the standard chain rule cannot be uniquely inverted to map a preconditioned {W}-space direction back to a factor-space update. We cast existing LoRA optimizers in a unified framework parameterized by two choices: (i) which invertible surrogate for J_{G}^* {F}_t J_{G} to use, and (ii) which {F}_t on {W} to use. Existing methods occupy four families along these axes: factor-space adaptive updates, block-diagonal surrogates for J_{G}^* J_{G}, Frobenius-residual pseudoinverse methods, and Riemannian manifold constraint. Within this design space, a gradient-statistics-aware {F}_t paired with a closed-form factor-space solve at {O}((m+n)r) memory remains underexplored. We propose AdaPreLoRA, which fills this gap by adopting the Adafactor diagonal Kronecker preconditioner {H}_t on {W} and selecting from the resulting factor-space solution family the element minimizing an {H}_t-weighted imbalance between the two factor contributions; by construction, the resulting factor update is the closest LoRA approximation to the preconditioned {W}-space direction under the {H}_t-weighted norm. Across GPT-2 (E2E), Mistral-7B and Qwen2-7B (GLUE, ARC, GSM8K), and diffusion-model personalization, AdaPreLoRA is competitive with or improves over a representative set of LoRA optimizers while keeping peak GPU memory at the LoRA optimizer level.