Entrenamiento autoguiado en tiempo de prueba para LLMs de contexto largo
Self-Guided Test-Time Training for Long-Context LLMs
July 10, 2026
Autores: Xinyu Zhu, Zhe Xu, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Kaushik Rangadurai, Hua Zhi, Frank Shyu, Sandeep Pandey, Luke Simon, Yu Meng, Xi Liu
cs.AI
Resumen
El procesamiento de contextos largos se ha vuelto cada vez más importante para los modelos de lenguaje grandes (LLMs), pero simplemente extender la ventana de contexto no garantiza una utilización efectiva de entradas extensas. A medida que crece la longitud de la entrada, la precisión suele degradarse, lo que indica que los modelos aún tienen dificultades para identificar y utilizar la evidencia más relevante para una pregunta. Una forma prometedora de mejorar la utilización de contextos largos es el entrenamiento en tiempo de prueba (TTT), que trata el contexto de prueba como un ejemplo de entrenamiento para la adaptación de parámetros específica de la instancia. Sin embargo, aplicar TTT a todo el contexto largo es prohibitivamente costoso, mientras que adaptarse en fragmentos muestreados aleatoriamente introduce un ruido severo. Dado que la mayoría de los fragmentos en un contexto largo son irrelevantes para la pregunta específica, entrenar en ellos puede incluso degradar el rendimiento del modelo base. Nuestro estudio preliminar muestra que TTT es altamente sensible a la calidad de los fragmentos de entrenamiento: en LongBench-v2, TTT en fragmentos muestreados aleatoriamente perjudica el rendimiento, mientras que TTT en fragmentos óptimos lo mejora sustancialmente. Motivados por esto, proponemos un método simple, TTT Autoguiado (S-TTT): antes de la adaptación, el modelo identifica los fragmentos de evidencia de los que debe aprender, y el objetivo estándar de entrenamiento de modelado del lenguaje se aplica solo a esos fragmentos seleccionados. En dos benchmarks desafiantes de razonamiento en contextos largos, LongBench-v2 y LongBench-Pro, S-TTT mejora la precisión tanto para Qwen3-4B-Thinking-2507 como para Llama-3.1-8B-Instruct, logrando hasta un 15% de mejora relativa.
English
Long-context processing has become increasingly important for large language models (LLMs), but simply extending the context window does not guarantee effective utilization of long inputs. As input length grows, accuracy often degrades, indicating that models still struggle to identify and use the evidence most relevant to a question. A promising way to improve long-context utilization is test-time training (TTT), which treats the test context as a training example for instance-specific parameter adaptation. However, applying TTT to the entire long context is prohibitively expensive, while adapting on randomly sampled spans introduces severe noise. Because most spans in a long context are irrelevant to the specific question, training on them may even degrade the base model's performance. Our preliminary study shows that TTT is highly sensitive to training-span quality: on LongBench-v2, TTT on randomly sampled spans hurts performance, whereas TTT on oracle spans substantially improves it. Motivated by this, we propose a simple method, Self-Guided TTT (S-TTT): before adaptation, the model identifies the evidence spans it should learn from, and the standard language-modeling training objective is applied only to those selected spans. On two challenging long-context reasoning benchmarks, LongBench-v2 and LongBench-Pro, S-TTT improves accuracy for both Qwen3-4B-Thinking-2507 and Llama-3.1-8B-Instruct, achieving up to a 15% relative improvement.