ChatPaper.aiChatPaper

LoRA interrogeable : routage régularisé par instructions sur des atomes de mise à jour de bas rang partagés

Queryable LoRA: Instruction-Regularized Routing Over Shared Low-Rank Update Atoms

May 8, 2026
Auteurs: Omatharv Bharat Vaidya, Connor T. Jerzak, Nhat Ho, Chandrajit Bajaj
cs.AI

Résumé

Nous présentons une méthode adaptative aux données pour la mise au point efficace en paramètres des grands réseaux de neurones. Les méthodes standard d’adaptation de faible rang améliorent l’efficacité en restreignant la mise à jour de chaque couche à une forme de faible rang fixe, mais cette paramétrisation statique peut s’avérer trop rigide lorsque la correction appropriée dépend de l’entrée et du calcul évolutif en profondeur du réseau. Notre approche remplace un adaptateur purement local à une couche par une mémoire partagée interrogable constituée d’atomes de mise à jour de faible rang. Pour chaque bloc de couches, le modèle forme une requête à partir de l’état courant de faible rang et d’un résumé courant des blocs précédents, utilise cette requête pour récupérer une combinaison dépendante du contenu des composants de mise à jour partagés via l’attention, et applique l’opérateur routé résultant dans le goulot d’étranglement de faible rang. Ainsi, la méthode conserve l’efficacité et la passation à l’échelle de l’adaptation de faible rang tout en permettant à la mise à jour effective de varier selon les entrées et de partager des structures réutilisables entre les couches. L’architecture résultante offre un juste milieu fondé entre les mises à jour statiques de type LoRA et les mises à jour de paramètres entièrement générées : elle reste compacte et efficace en paramètres tout en permettant une adaptation dynamique et sensible au contexte. De plus, nous intégrons une régularisation par instructions en augmentant les logits de routage avec un a priori induit par le langage sur les atomes de mise à jour, ce qui biaise la sélection des transformations de faible rang vers des directions sémantiquement pertinentes sans générer des mises à jour de paramètres non contraintes. Les expériences sur des tâches de régression non linéaire bruitée et sur la mise au point de LLM suggèrent que cette formulation de mémoire de mise à jour interrogable peut améliorer la performance finale en test et la stabilité de l’entraînement par rapport à l’adaptation de faible rang standard, tout en utilisant un nombre comparable de paramètres entraînables.
English
We present a data-adaptive method for parameter-efficient fine-tuning of large neural networks. Standard low-rank adaptation methods improve efficiency by restricting each layer update to a fixed low-rank form, but this static parameterization can be too rigid when the appropriate correction depends on the input and on the evolving depth-wise computation of the network. Our approach replaces a purely layer-local adapter with a shared queryable memory of low-rank update atoms. For each block of layers, the model forms a query from the current low-rank state and a running summary of previous blocks, uses this query to retrieve a content-dependent combination of shared update components via attention, and applies the resulting routed operator within the low-rank bottleneck. In this way, the method retains the efficiency and scalability of low-rank adaptation while allowing the effective update to vary across inputs and to share reusable structure across layers. The resulting architecture provides a principled middle ground between static LoRA-style updates and fully generated parameter updates: it remains compact and parameter-efficient while supporting dynamic, context-sensitive adaptation. Further, we incorporate instruction-regularization by augmenting routing logits with a language-induced prior over update atoms, thereby biasing the selection of low-rank transformations toward semantically relevant directions without generating unconstrained parameter updates. Experiments on noisy non-linear regression tasks and LLM fine-tuning suggest that this queryable update-memory formulation can improve final test performance and training stability compared to standard low-rank adaptation, while using a comparable number of trainable parameters.