ChatPaper.aiChatPaper

Leren, snel en langzaam: naar LLM's die zich continu aanpassen

Learning, Fast and Slow: Towards LLMs That Adapt Continually

May 12, 2026
Auteurs: Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Rishabh Agarwal, Devvrit Khatri
cs.AI

Samenvatting

Grote taalmodellen (GTM's) worden getraind voor stroomafwaartse taken door hun parameters bij te werken (bijv. via RL). Het bijwerken van parameters dwingt hen echter om taakspecifieke informatie te absorberen, wat kan leiden tot catastrofale vergeten en verlies van plasticiteit. Daarentegen kan in-context leren met vaste GTM-parameters goedkoop en snel aanpassen aan taakspecifieke vereisten (bijv. promptoptimalisatie), maar kan het op zichzelf meestal niet de prestatiewinsten evenaren die beschikbaar zijn via het bijwerken van GTM-parameters. Er is geen goede reden om leren te beperken tot in-context of in-gewichten. Bovendien leren mensen waarschijnlijk ook op verschillende tijdschalen (bijv. Systeem 1 versus 2). Daartoe introduceren we een snel-langzaam leerraamwerk voor GTM's, met modelparameters als 'langzame' gewichten en geoptimaliseerde context als 'snelle' gewichten. Deze snelle 'gewichten' kunnen leren van tekstuele feedback om de taakspecifieke informatie te absorberen, terwijl langzame gewichten dichter bij het basismodel kunnen blijven en algemeen redeneergedrag kunnen behouden. Fast-Slow Training (FST) is tot 3x meer sample-efficiënt dan alleen langzaam leren (RL) bij redeneertaken, terwijl het consistent een hogere prestaties asymptoot bereikt. Bovendien blijven FST-getrainde modellen dichter bij het basis-GTM (tot 70% minder KL-divergentie), wat resulteert in minder catastrofale vergeten dan RL-training. Deze verminderde drift behoudt ook plasticiteit: na training op één taak passen FST-getrainde modellen zich effectiever aan een volgende taak aan dan alleen-parameter-getrainde modellen. In continu-leer-scenario's, waar taakdomeinen on-the-fly veranderen, blijft FST elke nieuwe taak verwerven, terwijl alleen-parameter-RL stagneert.
English
Large language models (LLMs) are trained for downstream tasks by updating their parameters (e.g., via RL). However, updating parameters forces them to absorb task-specific information, which can result in catastrophic forgetting and loss of plasticity. In contrast, in-context learning with fixed LLM parameters can cheaply and rapidly adapt to task-specific requirements (e.g., prompt optimization), but cannot by itself typically match the performance gains available through updating LLM parameters. There is no good reason for restricting learning to being in-context or in-weights. Moreover, humans also likely learn at different time scales (e.g., System 1 vs 2). To this end, we introduce a fast-slow learning framework for LLMs, with model parameters as "slow" weights and optimized context as "fast" weights. These fast "weights" can learn from textual feedback to absorb the task-specific information, while allowing slow weights to stay closer to the base model and persist general reasoning behaviors. Fast-Slow Training (FST) is up to 3x more sample-efficient than only slow learning (RL) across reasoning tasks, while consistently reaching a higher performance asymptote. Moreover, FST-trained models remain closer to the base LLM (up to 70% less KL divergence), resulting in less catastrophic forgetting than RL-training. This reduced drift also preserves plasticity: after training on one task, FST trained models adapt more effectively to a subsequent task than parameter-only trained models. In continual learning scenarios, where task domains change on the fly, FST continues to acquire each new task while parameter-only RL stalls.