ChatPaper.aiChatPaper

Entraînement Auto-Guidé au Moment du Test pour LLM à Contexte Long

Self-Guided Test-Time Training for Long-Context LLMs

July 10, 2026
Auteurs: Xinyu Zhu, Zhe Xu, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Kaushik Rangadurai, Hua Zhi, Frank Shyu, Sandeep Pandey, Luke Simon, Yu Meng, Xi Liu
cs.AI

Résumé

Le traitement de contextes longs est devenu de plus en plus important pour les grands modèles de langage (LLM), mais étendre simplement la fenêtre de contexte ne garantit pas une utilisation efficace des entrées longues. À mesure que la longueur de l'entrée augmente, la précision se dégrade souvent, ce qui indique que les modèles ont toujours du mal à identifier et à utiliser les preuves les plus pertinentes pour une question. Une approche prometteuse pour améliorer l'utilisation des contextes longs est l'entraînement au moment du test (TTT), qui traite le contexte de test comme un exemple d'entraînement pour une adaptation des paramètres spécifique à l'instance. Cependant, appliquer le TTT à l'ensemble du contexte long est prohibitif en termes de coût, tandis que l'adapter sur des segments échantillonnés aléatoirement introduit un bruit important. Étant donné que la plupart des segments dans un contexte long ne sont pas pertinents pour la question spécifique, l'entraînement sur ceux-ci peut même dégrader les performances du modèle de base. Notre étude préliminaire montre que le TTT est très sensible à la qualité des segments d'entraînement : sur LongBench-v2, le TTT sur des segments échantillonnés aléatoirement nuit aux performances, alors que le TTT sur des segments oracle les améliore sensiblement. Motivés par ce constat, nous proposons une méthode simple, le TTT auto-guidé (S-TTT) : avant l'adaptation, le modèle identifie les segments de preuves qu'il doit apprendre, et l'objectif standard d'entraînement de modélisation du langage n'est appliqué qu'à ces segments sélectionnés. Sur deux benchmarks exigeants de raisonnement en contexte long, LongBench-v2 et LongBench-Pro, le S-TTT améliore la précision pour Qwen3-4B-Thinking-2507 et Llama-3.1-8B-Instruct, réalisant jusqu'à 15% d'amélioration relative.
English
Long-context processing has become increasingly important for large language models (LLMs), but simply extending the context window does not guarantee effective utilization of long inputs. As input length grows, accuracy often degrades, indicating that models still struggle to identify and use the evidence most relevant to a question. A promising way to improve long-context utilization is test-time training (TTT), which treats the test context as a training example for instance-specific parameter adaptation. However, applying TTT to the entire long context is prohibitively expensive, while adapting on randomly sampled spans introduces severe noise. Because most spans in a long context are irrelevant to the specific question, training on them may even degrade the base model's performance. Our preliminary study shows that TTT is highly sensitive to training-span quality: on LongBench-v2, TTT on randomly sampled spans hurts performance, whereas TTT on oracle spans substantially improves it. Motivated by this, we propose a simple method, Self-Guided TTT (S-TTT): before adaptation, the model identifies the evidence spans it should learn from, and the standard language-modeling training objective is applied only to those selected spans. On two challenging long-context reasoning benchmarks, LongBench-v2 and LongBench-Pro, S-TTT improves accuracy for both Qwen3-4B-Thinking-2507 and Llama-3.1-8B-Instruct, achieving up to a 15% relative improvement.