ChatPaper.aiChatPaper

Apprendre à déclencher : apprentissage par renforcement au Grand collisionneur de hadrons

Learning to Trigger: Reinforcement Learning at the Large Hadron Collider

June 27, 2026
Auteurs: Zixin Ding, Shaghayegh Emami, Giovanna Salvi, Cecilia Tosciri, Abhijith Gandrakota, Jennifer Ngadiuba, Nhan Tran, Christian Herwig, David W. Miller, Yuxin Chen
cs.AI

Résumé

Les installations scientifiques à haut débit, comme le Grand Collisionneur de Hadrons (LHC), dépendent d'un filtrage d'événements en temps réel (déclenchement) sous des contraintes strictes de bande passante, de latence et de stockage. En pratique, les menus de déclenchement sont largement statiques et réglés manuellement, et peuvent devenir sous-optimaux à mesure que les conditions du détecteur, l'empilement et la composition du bruit de fond évoluent dans le temps. Nous formulons le réglage en ligne des seuils comme un problème de prise de décision séquentielle : un agent d'apprentissage par renforcement ingère des résumés en continu des taux récents et des caractéristiques sensibles au signal, et met à jour les seuils de déclenchement afin de maximiser l'efficacité du signal tout en maintenant un taux de bruit de fond cible dans une bande de tolérance. Nous adaptons l'Optimisation de Politique Filtrée par Groupe (GFPO) au contrôle en continu et introduisons deux variantes (GFPO-F, GFPO-FR) qui imposent la faisabilité du taux de bruit de fond pendant l'entraînement. Sur un banc d'essai simulant le fonctionnement réaliste du collisionneur, nous étudions deux déclenchements représentatifs : un déclencheur basé sur l'énergie transverse totale (H_T), sensible aux variations d'empilement, et un déclencheur de détection d'anomalies (AD) fondé sur la perte de reconstruction pour les signatures rares ou non standard. Sur des flux Monte Carlo, notre agent augmente la fraction des intervalles de temps dans la tolérance de 48 % (H_T) et 28 % (AD), avec un gain cumulé allant jusqu'à 2 % de l'efficacité du signal sur ces intervalles. En transférant de la simulation aux données réelles de collision (CMS Run 283408), le même agent, sans réglage fin, améliore de 56 % (H_T) et 28 % (AD) la proportion d'intervalles dans la tolérance par rapport aux références, avec un gain supplémentaire d'efficacité du signal sur les deux déclenchements. À notre connaissance, il s'agit de la première démonstration d'un contrôle de déclenchement basé sur l'apprentissage par renforcement sur des données réelles de collisions du Grand Collisionneur de Hadrons. Le code est disponible à l'adresse https://github.com/Zixind/GFPO_LHC (voir le dépôt pour plus de détails).
English
High-throughput scientific facilities such as the Large Hadron Collider depend on real-time event filtering (triggering) under tight constraints on bandwidth, latency, and storage. In practice, trigger menus are largely static and hand-tuned and can become suboptimal as detector conditions, pileup, and background composition drift over time. We cast online threshold tuning as a sequential decision-making problem: a reinforcement learning agent ingests streaming summaries of recent rates and signal-sensitive features and updates trigger thresholds to maximize signal efficiency while tracking a target background rate within a tolerance band. We adapt Group-Filtered Policy Optimization (GFPO) to streaming control and introduce two variants (GFPO-F, GFPO-FR) that enforce background rate feasibility during training. On a benchmark that emulates realistic collider operation, we study two representative triggers: a total transverse energy (H_{T}) trigger sensitive to pileup variation, and an anomaly-detection (AD) trigger based on reconstruction loss for rare or non-standard signatures. On Monte Carlo streams, our agent increases the fraction of in-tolerance time intervals by 48\% (H_T) and 28\% (AD), with a cumulative gain of up to 2\% in signal efficiency on those in-tolerance intervals. Transferring from simulation to real collision data (CMS Run 283408), the same agent, without fine-tuning, achieves a 56\% (H_T) and 28\% (AD) in-tolerance improvement over baselines, with further signal-efficiency gain on both triggers. To our knowledge, this is the first demonstration of RL-based trigger control on real Large Hadron Collider collision data. Code is available at https://github.com/Zixind/GFPO_LHC (see repo for details).