ChatPaper.aiChatPaper

Aprendizagem, Rápida e Lenta: Rumo a LLMs que se Adaptam Continuamente

Learning, Fast and Slow: Towards LLMs That Adapt Continually

May 12, 2026
Autores: Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Rishabh Agarwal, Devvrit Khatri
cs.AI

Resumo

Modelos de linguagem de grande escala (LLMs) são treinados para tarefas subsequentes por meio da atualização de seus parâmetros (por exemplo, via RL). No entanto, a atualização dos parâmetros os força a absorver informações específicas da tarefa, o que pode resultar em esquecimento catastrófico e perda de plasticidade. Em contraste, o aprendizado em contexto com parâmetros fixos do LLM pode se adaptar de forma econômica e rápida a requisitos específicos de tarefas (por exemplo, otimização de prompt), mas, por si só, geralmente não consegue igualar os ganhos de desempenho obtidos com a atualização dos parâmetros do LLM. Não há uma boa razão para restringir o aprendizado a ser contextual ou baseado em pesos. Além disso, os humanos também provavelmente aprendem em diferentes escalas de tempo (por exemplo, Sistema 1 vs 2). Para tanto, introduzimos uma estrutura de aprendizado rápido-lento para LLMs, com parâmetros do modelo como pesos "lentos" e contexto otimizado como pesos "rápidos". Esses pesos "rápidos" podem aprender com feedback textual para absorver informações específicas da tarefa, enquanto permitem que os pesos lentos permaneçam mais próximos do modelo base e persistam em comportamentos gerais de raciocínio. O Treinamento Rápido-Lento (Fast-Slow Training, FST) é até 3 vezes mais eficiente em termos de amostras do que apenas o aprendizado lento (RL) em tarefas de raciocínio, alcançando consistentemente uma assíntota de desempenho mais alta. Além disso, os modelos treinados com FST permanecem mais próximos do LLM base (até 70% menos divergência KL), resultando em menos esquecimento catastrófico do que o treinamento com RL. Essa deriva reduzida também preserva a plasticidade: após o treinamento em uma tarefa, os modelos treinados com FST se adaptam mais efetivamente a uma tarefa subsequente do que os modelos treinados apenas com parâmetros. Em cenários de aprendizado contínuo, onde os domínios das tarefas mudam dinamicamente, o FST continua adquirindo cada nova tarefa enquanto o RL baseado apenas em parâmetros estagna.
English
Large language models (LLMs) are trained for downstream tasks by updating their parameters (e.g., via RL). However, updating parameters forces them to absorb task-specific information, which can result in catastrophic forgetting and loss of plasticity. In contrast, in-context learning with fixed LLM parameters can cheaply and rapidly adapt to task-specific requirements (e.g., prompt optimization), but cannot by itself typically match the performance gains available through updating LLM parameters. There is no good reason for restricting learning to being in-context or in-weights. Moreover, humans also likely learn at different time scales (e.g., System 1 vs 2). To this end, we introduce a fast-slow learning framework for LLMs, with model parameters as "slow" weights and optimized context as "fast" weights. These fast "weights" can learn from textual feedback to absorb the task-specific information, while allowing slow weights to stay closer to the base model and persist general reasoning behaviors. Fast-Slow Training (FST) is up to 3x more sample-efficient than only slow learning (RL) across reasoning tasks, while consistently reaching a higher performance asymptote. Moreover, FST-trained models remain closer to the base LLM (up to 70% less KL divergence), resulting in less catastrophic forgetting than RL-training. This reduced drift also preserves plasticity: after training on one task, FST trained models adapt more effectively to a subsequent task than parameter-only trained models. In continual learning scenarios, where task domains change on the fly, FST continues to acquire each new task while parameter-only RL stalls.