Treinamento em Tempo de Teste Autoguiado para LLMs de Contexto Longo
Self-Guided Test-Time Training for Long-Context LLMs
July 10, 2026
Autores: Xinyu Zhu, Zhe Xu, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Kaushik Rangadurai, Hua Zhi, Frank Shyu, Sandeep Pandey, Luke Simon, Yu Meng, Xi Liu
cs.AI
Resumo
O processamento de contexto longo tem se tornado cada vez mais importante para modelos de linguagem de grande escala (LLMs), mas simplesmente estender a janela de contexto não garante a utilização eficaz de entradas longas. À medida que o comprimento da entrada cresce, a precisão frequentemente se degrada, indicando que os modelos ainda têm dificuldade em identificar e usar as evidências mais relevantes para uma pergunta. Uma abordagem promissora para melhorar a utilização de contexto longo é o treinamento em tempo de teste (TTT), que trata o contexto de teste como um exemplo de treinamento para adaptação de parâmetros específica da instância. No entanto, aplicar TTT a todo o contexto longo é proibitivamente caro, enquanto adaptar-se a segmentos amostrados aleatoriamente introduz ruído severo. Como a maioria dos segmentos em um contexto longo é irrelevante para a pergunta específica, treinar neles pode até degradar o desempenho do modelo base. Nosso estudo preliminar mostra que o TTT é altamente sensível à qualidade dos segmentos de treinamento: no LongBench-v2, o TTT em segmentos amostrados aleatoriamente prejudica o desempenho, enquanto o TTT em segmentos de referência o melhora substancialmente. Motivados por isso, propomos um método simples, o TTT Autoguiado (S-TTT): antes da adaptação, o modelo identifica os segmentos de evidência dos quais deve aprender, e o objetivo padrão de treinamento de modelagem de linguagem é aplicado apenas a esses segmentos selecionados. Em dois desafiadores benchmarks de raciocínio de contexto longo, LongBench-v2 e LongBench-Pro, o S-TTT melhora a precisão tanto para Qwen3-4B-Thinking-2507 quanto para Llama-3.1-8B-Instruct, alcançando uma melhoria relativa de até 15%.
English
Long-context processing has become increasingly important for large language models (LLMs), but simply extending the context window does not guarantee effective utilization of long inputs. As input length grows, accuracy often degrades, indicating that models still struggle to identify and use the evidence most relevant to a question. A promising way to improve long-context utilization is test-time training (TTT), which treats the test context as a training example for instance-specific parameter adaptation. However, applying TTT to the entire long context is prohibitively expensive, while adapting on randomly sampled spans introduces severe noise. Because most spans in a long context are irrelevant to the specific question, training on them may even degrade the base model's performance. Our preliminary study shows that TTT is highly sensitive to training-span quality: on LongBench-v2, TTT on randomly sampled spans hurts performance, whereas TTT on oracle spans substantially improves it. Motivated by this, we propose a simple method, Self-Guided TTT (S-TTT): before adaptation, the model identifies the evidence spans it should learn from, and the standard language-modeling training objective is applied only to those selected spans. On two challenging long-context reasoning benchmarks, LongBench-v2 and LongBench-Pro, S-TTT improves accuracy for both Qwen3-4B-Thinking-2507 and Llama-3.1-8B-Instruct, achieving up to a 15% relative improvement.