ChatPaper.aiChatPaper

Leren Triggeren: Reinforcement Learning bij de Large Hadron Collider

Learning to Trigger: Reinforcement Learning at the Large Hadron Collider

June 27, 2026
Auteurs: Zixin Ding, Shaghayegh Emami, Giovanna Salvi, Cecilia Tosciri, Abhijith Gandrakota, Jennifer Ngadiuba, Nhan Tran, Christian Herwig, David W. Miller, Yuxin Chen
cs.AI

Samenvatting

Hoogdoorvoer wetenschappelijke faciliteiten zoals de Grote Hadronenbotser zijn afhankelijk van real-time gebeurtenisfiltering (triggering) onder strikte beperkingen op bandbreedte, latentie en opslag. In de praktijk zijn triggermenu's grotendeels statisch en handmatig afgesteld, en kunnen ze suboptimaal worden naarmate detectoromstandigheden, pileup en achtergrondsamenstelling in de loop van de tijd verschuiven. We modelleren online drempelafstemming als een sequentieel besluitvormingsprobleem: een bekrachtigingslerende agent verwerkt stromende samenvattingen van recente snelheden en signaalgevoelige kenmerken en werkt triggerniveaus bij om de signaalefficiëntie te maximaliseren terwijl een beoogde achtergrondsnelheid binnen een tolerantieband wordt gevolgd. We passen groepsgefilterde beleidsoptimalisatie (GFPO) aan voor stromingscontrole en introduceren twee varianten (GFPO-F, GFPO-FR) die de haalbaarheid van de achtergrondsnelheid tijdens de training afdwingen. Op een benchmark die realistische botsingsexperimenten nabootst, bestuderen we twee representatieve triggers: een totale transversale energie (H_{T})-trigger gevoelig voor pileupvariaties, en een anomaliedetectie (AD)-trigger gebaseerd op reconstructieverlies voor zeldzame of niet-standaard signalen. Op Monte Carlo-stromen verhoogt onze agent het aandeel tijdsintervallen binnen tolerantie met 48% (H_T) en 28% (AD), met een cumulatieve winst van maximaal 2% in signaalefficiëntie op die interventies binnen tolerantie. Overgaand van simulatie naar echte botsingsdata (CMS Run 283408) bereikt dezelfde agent, zonder verdere afstemming, een verbetering van 56% (H_T) en 28% (AD) binnen tolerantie ten opzichte van basislijnen, met verdere signaalefficiëntiewinst op beide triggers. Voor zover wij weten, is dit de eerste demonstratie van op bekrachtigingsleren gebaseerde triggercontrole op echte botsingsdata van de Grote Hadronenbotser. Code is beschikbaar op https://github.com/Zixind/GFPO_LHC (zie repository voor details).
English
High-throughput scientific facilities such as the Large Hadron Collider depend on real-time event filtering (triggering) under tight constraints on bandwidth, latency, and storage. In practice, trigger menus are largely static and hand-tuned and can become suboptimal as detector conditions, pileup, and background composition drift over time. We cast online threshold tuning as a sequential decision-making problem: a reinforcement learning agent ingests streaming summaries of recent rates and signal-sensitive features and updates trigger thresholds to maximize signal efficiency while tracking a target background rate within a tolerance band. We adapt Group-Filtered Policy Optimization (GFPO) to streaming control and introduce two variants (GFPO-F, GFPO-FR) that enforce background rate feasibility during training. On a benchmark that emulates realistic collider operation, we study two representative triggers: a total transverse energy (H_{T}) trigger sensitive to pileup variation, and an anomaly-detection (AD) trigger based on reconstruction loss for rare or non-standard signatures. On Monte Carlo streams, our agent increases the fraction of in-tolerance time intervals by 48\% (H_T) and 28\% (AD), with a cumulative gain of up to 2\% in signal efficiency on those in-tolerance intervals. Transferring from simulation to real collision data (CMS Run 283408), the same agent, without fine-tuning, achieves a 56\% (H_T) and 28\% (AD) in-tolerance improvement over baselines, with further signal-efficiency gain on both triggers. To our knowledge, this is the first demonstration of RL-based trigger control on real Large Hadron Collider collision data. Code is available at https://github.com/Zixind/GFPO_LHC (see repo for details).