ChatPaper.aiChatPaper

Aprendiendo a Disparar: Aprendizaje por Refuerzo en el Gran Colisionador de Hadrones

Learning to Trigger: Reinforcement Learning at the Large Hadron Collider

June 27, 2026
Autores: Zixin Ding, Shaghayegh Emami, Giovanna Salvi, Cecilia Tosciri, Abhijith Gandrakota, Jennifer Ngadiuba, Nhan Tran, Christian Herwig, David W. Miller, Yuxin Chen
cs.AI

Resumen

Las instalaciones científicas de alto rendimiento, como el Gran Colisionador de Hadrones, dependen del filtrado de eventos en tiempo real (trigger) bajo estrictas restricciones de ancho de banda, latencia y almacenamiento. En la práctica, los menús de trigger son en gran medida estáticos y ajustados manualmente, pudiendo volverse subóptimos a medida que las condiciones del detector, el apilamiento (pileup) y la composición del fondo evolucionan con el tiempo. Planteamos el ajuste en línea de umbrales como un problema de toma de decisiones secuencial: un agente de aprendizaje por refuerzo ingiere resúmenes continuos de tasas recientes y características sensibles a la señal, y actualiza los umbrales del trigger para maximizar la eficiencia de señal mientras sigue una tasa de fondo objetivo dentro de una banda de tolerancia. Adaptamos la Optimización de Políticas Filtradas por Grupo (GFPO) al control en flujo continuo e introducimos dos variantes (GFPO-F, GFPO-FR) que imponen la viabilidad de la tasa de fondo durante el entrenamiento. En un punto de referencia que emula la operación realista del colisionador, estudiamos dos triggers representativos: un trigger de energía transversa total (H_{T}), sensible a variaciones de pileup, y un trigger de detección de anomalías (AD) basado en la pérdida de reconstrucción para firmas raras o no estándar. En flujos de Monte Carlo, nuestro agente incrementa la fracción de intervalos de tiempo dentro de la tolerancia en un 48% (H_T) y un 28% (AD), con una ganancia acumulada de hasta un 2% en eficiencia de señal en esos intervalos dentro de tolerancia. Al transferir de simulación a datos reales de colisión (CMS Run 283408), el mismo agente, sin ajuste fino, logra una mejora del 56% (H_T) y 28% (AD) en intervalos dentro de tolerancia respecto a las líneas base, con una ganancia adicional en eficiencia de señal en ambos triggers. Hasta donde sabemos, esta es la primera demostración de control de trigger basado en aprendizaje por refuerzo sobre datos reales de colisión del Gran Colisionador de Hadrones. El código está disponible en https://github.com/Zixind/GFPO_LHC (ver repositorio para más detalles).
English
High-throughput scientific facilities such as the Large Hadron Collider depend on real-time event filtering (triggering) under tight constraints on bandwidth, latency, and storage. In practice, trigger menus are largely static and hand-tuned and can become suboptimal as detector conditions, pileup, and background composition drift over time. We cast online threshold tuning as a sequential decision-making problem: a reinforcement learning agent ingests streaming summaries of recent rates and signal-sensitive features and updates trigger thresholds to maximize signal efficiency while tracking a target background rate within a tolerance band. We adapt Group-Filtered Policy Optimization (GFPO) to streaming control and introduce two variants (GFPO-F, GFPO-FR) that enforce background rate feasibility during training. On a benchmark that emulates realistic collider operation, we study two representative triggers: a total transverse energy (H_{T}) trigger sensitive to pileup variation, and an anomaly-detection (AD) trigger based on reconstruction loss for rare or non-standard signatures. On Monte Carlo streams, our agent increases the fraction of in-tolerance time intervals by 48\% (H_T) and 28\% (AD), with a cumulative gain of up to 2\% in signal efficiency on those in-tolerance intervals. Transferring from simulation to real collision data (CMS Run 283408), the same agent, without fine-tuning, achieves a 56\% (H_T) and 28\% (AD) in-tolerance improvement over baselines, with further signal-efficiency gain on both triggers. To our knowledge, this is the first demonstration of RL-based trigger control on real Large Hadron Collider collision data. Code is available at https://github.com/Zixind/GFPO_LHC (see repo for details).