Les grands modèles de langage peuvent-ils réinventer les algorithmes fondamentaux ?
Can Large Language Models Reinvent Foundational Algorithms?
April 7, 2026
Auteurs: Jian Zhao, Haoren Luo, Yu Wang, Yuhan Cao, Pingyue Sheng, Tianxing He
cs.AI
Résumé
Les grands modèles de langage (LLM) ont montré un fort potentiel pour faire progresser la découverte scientifique. La question de savoir s'ils possèdent la capacité d'innovation fondamentale reste cependant ouverte. Dans ce travail, nous nous concentrons sur un prérequis pour l'innovation fondamentale : les LLM peuvent-ils réinventer les algorithmes fondamentaux en informatique ? Notre pipeline *Unlearn-and-Reinvent* applique le *désapprentissage* (*unlearning*) à un LLM pour supprimer un algorithme fondamental spécifique, comme l'algorithme de Dijkstra ou celui d'Euclide, des connaissances pré-entraînées du modèle, puis teste si celui-ci peut le réinventer dans un environnement contrôlé. Pour permettre un désapprentissage efficace, nous adoptons une méthode de désapprentissage *on-policy* basée sur GRPO. Sur 10 algorithmes cibles, 3 modèles open-weight performants et 3 niveaux d'indice, nos expériences démontrent que (1) le modèle le plus performant, Qwen3-4B-Thinking-2507, réinvente avec succès 50 % des algorithmes sans indice, 70 % au niveau d'indice 1 et 90 % au niveau d'indice 2 ; (2) quelques indices de haut niveau peuvent améliorer le taux de réussite de la réinvention, mais même des indications étape par étape échouent pour les algorithmes complexes ; et (3) l'apprentissage par renforcement au moment du test (*test-time reinforcement learning*) permet une réinvention réussie de l'algorithme de Strassen au niveau d'indice 2. Par des analyses des trajectoires de sortie et des études d'ablation, nous constatons que le vérificateur génératif (*generative verifier*) dans la phase de réinvention joue un rôle crucial pour maintenir la force de raisonnement des modèles, aidant à éviter le phénomène d'« effondrement de la pensée » (*thought collapse*). Ces résultats offrent un éclairage à la fois sur le potentiel et les limites actuelles de la pensée innovante des LLM.
English
LLMs have shown strong potential to advance scientific discovery. Whether they possess the capacity for foundational innovation, however, remains an open question. In this work, we focus on a prerequisite for foundational innovation: can LLMs reinvent foundational algorithms in computer science? Our Unlearn-and-Reinvent pipeline applies LLM unlearning to remove a specific foundational algorithm, such as Dijkstra's or Euclid's algorithm, from an LLM's pretrained knowledge, and then tests whether the model can reinvent it in a controlled environment. To enable effective unlearning, we adopt a GRPO-based, on-policy unlearning method. Across 10 target algorithms, 3 strong open-weight models, and 3 hint levels, our experiments demonstrate that (1) the strongest model Qwen3-4B-Thinking-2507 successfully reinvents 50% of the algorithms with no hint, 70% at hint level 1, and 90% at hint level 2; (2) a few high-level hints can enhance the reinvention success rate, but even step-by-step hints fail for those complicated algorithms; and (3) test-time reinforcement learning enables successful reinvention for the Strassen algorithm at hint level 2. Through analyses of output trajectories and ablation studies, we find that generative verifier in the reinvention phase plays a critical role in sustaining models' reasoning strength, helping to avoid the ``thought collapse'' phenomenon. These findings offer insights into both the potential and current limits of LLMs' innovative thinking.