ChatPaper.aiChatPaper

Aprendendo a Acionar: Aprendizagem por Reforço no Grande Colisor de Hádrons

Learning to Trigger: Reinforcement Learning at the Large Hadron Collider

June 27, 2026
Autores: Zixin Ding, Shaghayegh Emami, Giovanna Salvi, Cecilia Tosciri, Abhijith Gandrakota, Jennifer Ngadiuba, Nhan Tran, Christian Herwig, David W. Miller, Yuxin Chen
cs.AI

Resumo

Instalações científicas de alto rendimento, como o Grande Colisor de Hádrons (LHC), dependem de filtragem de eventos em tempo real (trigger) sob restrições rigorosas de largura de banda, latência e armazenamento. Na prática, os menus de trigger são em grande parte estáticos e ajustados manualmente, podendo tornar-se subótimos à medida que as condições do detector, o empilhamento (pileup) e a composição do fundo mudam ao longo do tempo. Propomos o ajuste online de limiares como um problema de tomada de decisão sequencial: um agente de aprendizado por reforço processa sumários em fluxo contínuo de taxas recentes e características sensíveis ao sinal, atualizando os limiares do trigger para maximizar a eficiência do sinal enquanto segue uma taxa de fundo alvo dentro de uma banda de tolerância. Adaptamos a Otimização de Política Filtrada por Grupo (Group-Filtered Policy Optimization, GFPO) para controle em fluxo contínuo e introduzimos duas variantes (GFPO-F e GFPO-FR) que impõem a viabilidade da taxa de fundo durante o treinamento. Em um benchmark que emula a operação realista do colisor, estudamos dois triggers representativos: um trigger de energia transversal total (H_T), sensível a variações no empilhamento, e um trigger de detecção de anomalias (AD), baseado em perda de reconstrução para assinaturas raras ou não padronizadas. Em fluxos de Monte Carlo, nosso agente aumenta a fração de intervalos de tempo dentro da tolerância em 48% (H_T) e 28% (AD), com um ganho cumulativo de até 2% na eficiência do sinal nesses intervalos dentro da tolerância. Ao transferir da simulação para dados reais de colisão (CMS Run 283408), o mesmo agente, sem ajuste fino, alcança uma melhoria de 56% (H_T) e 28% (AD) na tolerância em relação às referências, com ganho adicional de eficiência de sinal em ambos os triggers. Até onde sabemos, esta é a primeira demonstração de controle de trigger baseado em aprendizado por reforço em dados reais de colisão do Grande Colisor de Hádrons. O código está disponível em https://github.com/Zixind/GFPO_LHC (consulte o repositório para mais detalhes).
English
High-throughput scientific facilities such as the Large Hadron Collider depend on real-time event filtering (triggering) under tight constraints on bandwidth, latency, and storage. In practice, trigger menus are largely static and hand-tuned and can become suboptimal as detector conditions, pileup, and background composition drift over time. We cast online threshold tuning as a sequential decision-making problem: a reinforcement learning agent ingests streaming summaries of recent rates and signal-sensitive features and updates trigger thresholds to maximize signal efficiency while tracking a target background rate within a tolerance band. We adapt Group-Filtered Policy Optimization (GFPO) to streaming control and introduce two variants (GFPO-F, GFPO-FR) that enforce background rate feasibility during training. On a benchmark that emulates realistic collider operation, we study two representative triggers: a total transverse energy (H_{T}) trigger sensitive to pileup variation, and an anomaly-detection (AD) trigger based on reconstruction loss for rare or non-standard signatures. On Monte Carlo streams, our agent increases the fraction of in-tolerance time intervals by 48\% (H_T) and 28\% (AD), with a cumulative gain of up to 2\% in signal efficiency on those in-tolerance intervals. Transferring from simulation to real collision data (CMS Run 283408), the same agent, without fine-tuning, achieves a 56\% (H_T) and 28\% (AD) in-tolerance improvement over baselines, with further signal-efficiency gain on both triggers. To our knowledge, this is the first demonstration of RL-based trigger control on real Large Hadron Collider collision data. Code is available at https://github.com/Zixind/GFPO_LHC (see repo for details).