ChatPaper.aiChatPaper

Самонаправленное обучение во время тестирования для длинноконтекстных LLM

Self-Guided Test-Time Training for Long-Context LLMs

July 10, 2026
Авторы: Xinyu Zhu, Zhe Xu, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Kaushik Rangadurai, Hua Zhi, Frank Shyu, Sandeep Pandey, Luke Simon, Yu Meng, Xi Liu
cs.AI

Аннотация

Обработка длинных контекстов становится все более важной для больших языковых моделей (LLM), однако простое расширение контекстного окна не гарантирует эффективного использования длинных входных данных. По мере увеличения длины входных данных точность часто снижается, что указывает на то, что модели все еще испытывают трудности с выявлением и использованием свидетельств, наиболее релевантных вопросу. Перспективным способом улучшения использования длинных контекстов является обучение во время тестирования (TTT), которое рассматривает тестовый контекст как обучающий пример для адаптации параметров под конкретный экземпляр. Однако применение TTT ко всему длинному контексту чрезвычайно затратно, в то время как адаптация на случайно выбранных отрезках вносит значительный шум. Поскольку большинство отрезков в длинном контексте нерелевантны конкретному вопросу, обучение на них может даже ухудшить производительность базовой модели. Наше предварительное исследование показывает, что TTT очень чувствителен к качеству обучающих отрезков: на LongBench-v2 TTT на случайно выбранных отрезках вредит производительности, тогда как TTT на эталонных отрезках значительно ее улучшает. Руководствуясь этим, мы предлагаем простой метод — самоуправляемое TTT (S-TTT): перед адаптацией модель определяет отрезки-свидетельства, на которых ей следует учиться, и стандартная функция потерь языкового моделирования применяется только к этим выбранным отрезкам. На двух сложных бенчмарках для рассуждений с длинным контекстом, LongBench-v2 и LongBench-Pro, S-TTT повышает точность как для Qwen3-4B-Thinking-2507, так и для Llama-3.1-8B-Instruct, достигая до 15% относительного улучшения.
English
Long-context processing has become increasingly important for large language models (LLMs), but simply extending the context window does not guarantee effective utilization of long inputs. As input length grows, accuracy often degrades, indicating that models still struggle to identify and use the evidence most relevant to a question. A promising way to improve long-context utilization is test-time training (TTT), which treats the test context as a training example for instance-specific parameter adaptation. However, applying TTT to the entire long context is prohibitively expensive, while adapting on randomly sampled spans introduces severe noise. Because most spans in a long context are irrelevant to the specific question, training on them may even degrade the base model's performance. Our preliminary study shows that TTT is highly sensitive to training-span quality: on LongBench-v2, TTT on randomly sampled spans hurts performance, whereas TTT on oracle spans substantially improves it. Motivated by this, we propose a simple method, Self-Guided TTT (S-TTT): before adaptation, the model identifies the evidence spans it should learn from, and the standard language-modeling training objective is applied only to those selected spans. On two challenging long-context reasoning benchmarks, LongBench-v2 and LongBench-Pro, S-TTT improves accuracy for both Qwen3-4B-Thinking-2507 and Llama-3.1-8B-Instruct, achieving up to a 15% relative improvement.