ChatPaper.aiChatPaper

Many-Shot CoT-ICL : rendre l’apprentissage en contexte véritablement apprenant

Many-Shot CoT-ICL: Making In-Context Learning Truly Learn

May 13, 2026
Auteurs: Tsz Ting Chung, Lemao Liu, Mo Yu, Dit-Yan Yeung
cs.AI

Résumé

L'apprentissage en contexte (ICL) adapte les grands modèles de langage (LLMs) à de nouvelles tâches en se basant sur des démonstrations dans le prompt sans mise à jour des paramètres. Avec les modèles à contexte long, l'ICL à nombreux exemples peut utiliser des dizaines à des centaines d'exemples et atteindre des performances comparables au fine-tuning, mais la compréhension actuelle de son comportement d'échelle provient principalement de tâches non liées au raisonnement. Nous étudions l'apprentissage en contexte avec chaîne de pensée à nombreux exemples (CoT-ICL) pour le raisonnement et montrons que les règles standard des nombreux exemples ne se transfèrent pas. À travers des LLMs non orientés raisonnement et orientés raisonnement, et à travers des tâches non liées au raisonnement et de raisonnement, nous observons : (i) un effet d'échelle dépendant du contexte, où l'augmentation du nombre de démonstrations CoT est instable pour les LLMs non orientés raisonnement et bénéficie principalement aux LLMs orientés raisonnement ; (ii) la récupération basée sur la similarité aide sur les tâches non liées au raisonnement mais échoue sur le raisonnement, car la similarité sémantique prédit mal la compatibilité procédurale (c'est-à-dire CoT) ; et (iii) un effet d'échelle de l'ordre, où la variance des performances augmente avec davantage de démonstrations CoT. Nous interprétons ces comportements en considérant le CoT-ICL à nombreux exemples comme un apprentissage en contexte en phase de test plutôt qu'un appariement de motifs à grande échelle, et suggérons deux principes : (i) les démonstrations doivent être faciles à comprendre pour le modèle cible, et (ii) elles doivent être ordonnées pour soutenir une progression conceptuelle fluide. Guidés par ce principe, nous proposons la Sélection Curvilinéaire de Démonstrations (CDS), une méthode d'ordonnancement simple qui permet un gain allant jusqu'à 5,42 points de pourcentage en géométrie avec 64 démonstrations. Dans l'ensemble, nos résultats refaçonnent la fenêtre de contexte long, passant d'un réservoir de récupération à un curriculum structuré pour l'apprentissage en contexte en phase de test.
English
In-context learning (ICL) adapts large language models (LLMs) to new tasks by conditioning on demonstrations in the prompt without parameter updates. With long-context models, many-shot ICL can use dozens to hundreds of examples and achieve performance comparable to fine-tuning, yet current understanding of its scaling behavior is largely derived from non-reasoning tasks. We study many-shot chain-of-thought in-context learning (CoT-ICL) for reasoning and show that standard many-shot rules do not transfer. Across non-reasoning and reasoning-oriented LLMs and across non-reasoning and reasoning tasks, we find: (i) a setting-dependent scaling effect, where increasing the number of CoT demonstrations is unstable for non-reasoning LLMs and benefits mainly reasoning-oriented LLMs; (ii) similarity-based retrieval helps on non-reasoning tasks but fails on reasoning, since semantic similarity poorly predicts procedural (i.e., CoT) compatibility; and (iii) an order-scaling effect, where performance variance grows with more CoT demonstrations. We interpret these behaviors by viewing many-shot CoT-ICL as in-context test-time learning rather than scaled pattern matching, and suggests two principles: (i) demonstrations should be easy for the target model to understand, and (ii) they should be ordered to support a smooth conceptual progression. Guided by the principle, we propose Curvilinear Demonstration Selection (CDS), a simple ordering method that yields up to a 5.42 percentage-point gain on geometry with 64 demonstrations. Overall, our results reframe the long context window from a retrieval buffer into a structured curriculum for in-context test-time learning.