Querybare LoRA: Instructie-geregulariseerde Routering over Gedeelde Laag-Rang Update Atomen
Queryable LoRA: Instruction-Regularized Routing Over Shared Low-Rank Update Atoms
May 8, 2026
Auteurs: Omatharv Bharat Vaidya, Connor T. Jerzak, Nhat Ho, Chandrajit Bajaj
cs.AI
Samenvatting
We presenteren een data-adaptieve methode voor parameter-efficiënte fine-tuning van grote neurale netwerken. Standaard lage-rang adaptatiemethoden verbeteren de efficiëntie door elke laagupdate te beperken tot een vaste lage-rang vorm, maar deze statische parameterisatie kan te rigide zijn wanneer de juiste correctie afhangt van de input en van de evoluerende dieptegewijze berekening van het netwerk. Onze aanpak vervangt een puur laaglokale adapter door een gedeeld bevraagbaar geheugen van lage-rang update-atomen. Voor elk blok lagen vormt het model een query op basis van de huidige lage-rang toestand en een lopende samenvatting van eerdere blokken, gebruikt deze query om via attention een inhoudsafhankelijke combinatie van gedeelde updatecomponenten op te halen, en past de resulterende gerouteerde operator toe binnen de lage-rang bottleneck. Op deze manier behoudt de methode de efficiëntie en schaalbaarheid van lage-rang adaptatie, terwijl de effectieve update kan variëren over inputs en herbruikbare structuur over lagen kan delen. De resulterende architectuur biedt een principieel middenweg tussen statische LoRA-achtige updates en volledig gegenereerde parameterupdates: hij blijft compact en parameter-efficiënt, terwijl hij dynamische, contextgevoelige adaptatie ondersteunt. Verder integreren we instructieregularisatie door de routeringslogits aan te vullen met een taal-geïnduceerde prior over update-atomen, waardoor de selectie van lage-rang transformaties wordt beïnvloed richting semantisch relevante richtingen, zonder onbeperkte parameterupdates te genereren. Experimenten op ruizige niet-lineaire regressietaken en LLM fine-tuning suggereren dat deze bevraagbare update-geheugen formulering de uiteindelijke testprestatie en trainingsstabiliteit kan verbeteren vergeleken met standaard lage-rang adaptatie, terwijl het een vergelijkbaar aantal trainbare parameters gebruikt.
English
We present a data-adaptive method for parameter-efficient fine-tuning of large neural networks. Standard low-rank adaptation methods improve efficiency by restricting each layer update to a fixed low-rank form, but this static parameterization can be too rigid when the appropriate correction depends on the input and on the evolving depth-wise computation of the network. Our approach replaces a purely layer-local adapter with a shared queryable memory of low-rank update atoms. For each block of layers, the model forms a query from the current low-rank state and a running summary of previous blocks, uses this query to retrieve a content-dependent combination of shared update components via attention, and applies the resulting routed operator within the low-rank bottleneck. In this way, the method retains the efficiency and scalability of low-rank adaptation while allowing the effective update to vary across inputs and to share reusable structure across layers. The resulting architecture provides a principled middle ground between static LoRA-style updates and fully generated parameter updates: it remains compact and parameter-efficient while supporting dynamic, context-sensitive adaptation. Further, we incorporate instruction-regularization by augmenting routing logits with a language-induced prior over update atoms, thereby biasing the selection of low-rank transformations toward semantically relevant directions without generating unconstrained parameter updates. Experiments on noisy non-linear regression tasks and LLM fine-tuning suggest that this queryable update-memory formulation can improve final test performance and training stability compared to standard low-rank adaptation, while using a comparable number of trainable parameters.