Zelfgeleide Testtijdtraining voor Lange-Context LLM's
Self-Guided Test-Time Training for Long-Context LLMs
July 10, 2026
Auteurs: Xinyu Zhu, Zhe Xu, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Kaushik Rangadurai, Hua Zhi, Frank Shyu, Sandeep Pandey, Luke Simon, Yu Meng, Xi Liu
cs.AI
Samenvatting
Verwerking van lange contexten is steeds belangrijker geworden voor grote taalmodellen (LLMs), maar een simpele verlenging van het contextvenster garandeert geen effectief gebruik van lange invoeren. Naarmate de invoerlengte toeneemt, neemt de nauwkeurigheid vaak af, wat erop wijst dat modellen nog moeite hebben met het identificeren en gebruiken van het bewijs dat het meest relevant is voor een vraag. Een veelbelovende manier om het gebruik van lange contexten te verbeteren, is test-time training (TTT), waarbij de testcontext wordt behandeld als een trainingsvoorbeeld voor instantie-specifieke parameteraanpassing. Het toepassen van TTT op de gehele lange context is echter prohibitief duur, terwijl aanpassing op willekeurig geselecteerde fragmenten ernstige ruis introduceert. Omdat de meeste fragmenten in een lange context irrelevant zijn voor de specifieke vraag, kan training daarop de prestaties van het basismodel zelfs verslechteren. Ons vooronderzoek toont aan dat TTT zeer gevoelig is voor de kwaliteit van trainingsfragmenten: op LongBench-v2 schaadt TTT op willekeurig geselecteerde fragmenten de prestaties, terwijl TTT op orakelfragmenten deze aanzienlijk verbetert. Gemotiveerd door dit stellen we een eenvoudige methode voor, Self-Guided TTT (S-TTT): vóór aanpassing identificeert het model de bewijsfragmenten waarvan het moet leren, en de standaard taalmodelleringsdoelstelling wordt alleen toegepast op die geselecteerde fragmenten. Op twee uitdagende benchmarks voor redeneren met lange contexten, LongBench-v2 en LongBench-Pro, verbetert S-TTT de nauwkeurigheid voor zowel Qwen3-4B-Thinking-2507 als Llama-3.1-8B-Instruct, met een relatieve verbetering tot 15%.
English
Long-context processing has become increasingly important for large language models (LLMs), but simply extending the context window does not guarantee effective utilization of long inputs. As input length grows, accuracy often degrades, indicating that models still struggle to identify and use the evidence most relevant to a question. A promising way to improve long-context utilization is test-time training (TTT), which treats the test context as a training example for instance-specific parameter adaptation. However, applying TTT to the entire long context is prohibitively expensive, while adapting on randomly sampled spans introduces severe noise. Because most spans in a long context are irrelevant to the specific question, training on them may even degrade the base model's performance. Our preliminary study shows that TTT is highly sensitive to training-span quality: on LongBench-v2, TTT on randomly sampled spans hurts performance, whereas TTT on oracle spans substantially improves it. Motivated by this, we propose a simple method, Self-Guided TTT (S-TTT): before adaptation, the model identifies the evidence spans it should learn from, and the standard language-modeling training objective is applied only to those selected spans. On two challenging long-context reasoning benchmarks, LongBench-v2 and LongBench-Pro, S-TTT improves accuracy for both Qwen3-4B-Thinking-2507 and Llama-3.1-8B-Instruct, achieving up to a 15% relative improvement.