ChatPaper.aiChatPaper

LoRA Consultável: Roteamento Regularizado por Instrução sobre Átomos de Atualização de Baixo Ranque Compartilhados

Queryable LoRA: Instruction-Regularized Routing Over Shared Low-Rank Update Atoms

May 8, 2026
Autores: Omatharv Bharat Vaidya, Connor T. Jerzak, Nhat Ho, Chandrajit Bajaj
cs.AI

Resumo

Apresentamos um método adaptativo aos dados para o ajuste fino eficiente em termos de parâmetros de grandes redes neurais. Métodos padrão de adaptação de baixo posto melhoram a eficiência ao restringir a atualização de cada camada a uma forma fixa de baixo posto, mas essa parametrização estática pode ser muito rígida quando a correção apropriada depende da entrada e da computação evolutiva ao longo da profundidade da rede. Nossa abordagem substitui um adaptador puramente local à camada por uma memória compartilhada consultável de átomos de atualização de baixo posto. Para cada bloco de camadas, o modelo forma uma consulta a partir do estado atual de baixo posto e um resumo contínuo de blocos anteriores, utiliza essa consulta para recuperar uma combinação dependente do conteúdo de componentes de atualização compartilhados via atenção, e aplica o operador roteado resultante dentro do gargalo de baixo posto. Dessa forma, o método mantém a eficiência e escalabilidade da adaptação de baixo posto, ao mesmo tempo que permite que a atualização efetiva varie entre entradas e compartilhe estrutura reutilizável entre camadas. A arquitetura resultante fornece um meio-termo fundamentado entre atualizações estáticas no estilo LoRA e atualizações de parâmetros totalmente geradas: ela permanece compacta e eficiente em parâmetros, enquanto suporta adaptação dinâmica e sensível ao contexto. Além disso, incorporamos regularização por instrução ao aumentar os logits de roteamento com um prior induzido por linguagem sobre os átomos de atualização, enviesando assim a seleção de transformações de baixo posto em direções semanticamente relevantes, sem gerar atualizações de parâmetros não restritas. Experimentos em tarefas de regressão não linear ruidosa e no ajuste fino de LLMs sugerem que essa formulação de memória de atualização consultável pode melhorar o desempenho final em teste e a estabilidade de treinamento em comparação com a adaptação padrão de baixo posto, utilizando um número comparável de parâmetros treináveis.
English
We present a data-adaptive method for parameter-efficient fine-tuning of large neural networks. Standard low-rank adaptation methods improve efficiency by restricting each layer update to a fixed low-rank form, but this static parameterization can be too rigid when the appropriate correction depends on the input and on the evolving depth-wise computation of the network. Our approach replaces a purely layer-local adapter with a shared queryable memory of low-rank update atoms. For each block of layers, the model forms a query from the current low-rank state and a running summary of previous blocks, uses this query to retrieve a content-dependent combination of shared update components via attention, and applies the resulting routed operator within the low-rank bottleneck. In this way, the method retains the efficiency and scalability of low-rank adaptation while allowing the effective update to vary across inputs and to share reusable structure across layers. The resulting architecture provides a principled middle ground between static LoRA-style updates and fully generated parameter updates: it remains compact and parameter-efficient while supporting dynamic, context-sensitive adaptation. Further, we incorporate instruction-regularization by augmenting routing logits with a language-induced prior over update atoms, thereby biasing the selection of low-rank transformations toward semantically relevant directions without generating unconstrained parameter updates. Experiments on noisy non-linear regression tasks and LLM fine-tuning suggest that this queryable update-memory formulation can improve final test performance and training stability compared to standard low-rank adaptation, while using a comparable number of trainable parameters.