ChatPaper.aiChatPaper

Apprentissage contextuel avec recherche active d'information

Context Training with Active Information Seeking

May 13, 2026
Auteurs: Zeyu Huang, Adhiguna Kuncoro, Qixuan Feng, Jiajun Shen, Lucio Dery, Arthur Szlam, Marc'Aurelio Ranzato
cs.AI

Résumé

La plupart des grands modèles de langage (LLMs) existants sont coûteux à adapter après leur déploiement, en particulier lorsqu'une tâche requiert des informations nouvellement produites ou des connaissances de niche spécialisées. Des travaux récents ont montré qu'en manipulant et en optimisant leur contexte, les LLMs peuvent être adaptés à des tâches en aval sans mise à jour de leurs poids. Cependant, la plupart des méthodes existantes restent en boucle fermée, ne reposant que sur la connaissance intrinsèque du modèle. Dans cet article, nous équipons ces optimiseurs de contexte d'outils de recherche Wikipedia et de navigateur pour une recherche active d'informations. Nous montrons que l'ajout naïf de ces outils à un pipeline standard d'optimisation séquentielle du contexte peut en réalité dégrader la performance par rapport aux approches de référence. Toutefois, lorsqu'elle est associée à une procédure d'entraînement basée sur la recherche qui maintient et élagage plusieurs contextes candidats, la recherche active d'informations apporte des gains constants et substantiels. Nous démontrons ces améliorations dans divers domaines, notamment la traduction à faibles ressources (Flores+), les scénarios de santé (HealthBench) et les tâches à forte composante de raisonnement (LiveCodeBench et Humanity's Last Exam). De plus, notre méthode s'avère économe en données, robuste face à différents hyperparamètres, et capable de générer des contextes textuels efficaces qui se généralisent bien à travers différents modèles.
English
Most existing large language models (LLMs) are expensive to adapt after deployment, especially when a task requires newly produced information or niche domain knowledge. Recent work has shown that, by manipulating and optimizing their context, LLMs can be tailored to downstream tasks without updating their weights. However, most existing methods remain closed-loop, relying solely on the model's intrinsic knowledge. In this paper, we equip these context optimizers with Wikipedia search and browser tools for active information seeking. We show that naively adding these tools to a standard sequential context optimization pipeline can actually degrade performance compared to baselines. However, when paired with a search-based training procedure that maintains and prunes multiple candidate contexts, active information seeking delivers consistent and substantial gains. We demonstrate these improvements across diverse domains, including low-resource translation (Flores+), health scenarios (HealthBench), and reasoning-heavy tasks (LiveCodeBench and Humanity's Last Exam). Furthermore, our method proves to be data-efficient, robust across different hyperparameters, and capable of generating effective textual contexts that generalize well across different models.