ChatPaper.aiChatPaper

Обучение триггированию: обучение с подкреплением на Большом адронном коллайдере

Learning to Trigger: Reinforcement Learning at the Large Hadron Collider

June 27, 2026
Авторы: Zixin Ding, Shaghayegh Emami, Giovanna Salvi, Cecilia Tosciri, Abhijith Gandrakota, Jennifer Ngadiuba, Nhan Tran, Christian Herwig, David W. Miller, Yuxin Chen
cs.AI

Аннотация

Высокопроизводительные научные установки, такие как Большой адронный коллайдер, зависят от фильтрации событий в реальном времени (триггирования) при жёстких ограничениях на пропускную способность, задержку и объём хранимых данных. На практике триггерные меню в значительной степени статичны и настраиваются вручную, что может приводить к субоптимальной работе по мере изменения условий детектора, наложения событий (pileup) и состава фона с течением времени. Мы формулируем задачу онлайн-настройки порогов как проблему последовательного принятия решений: агент обучения с подкреплением обрабатывает потоковые сводки последних скоростей срабатывания и чувствительных к сигналу признаков, обновляя пороги триггеров для максимизации эффективности отбора сигнала при отслеживании целевой скорости фона в пределах допустимого диапазона. Мы адаптируем оптимизацию политики с групповой фильтрацией (Group-Filtered Policy Optimization, GFPO) для управления потоковыми данными и вводим два варианта (GFPO-F, GFPO-FR), которые обеспечивают выполнение ограничения по скорости фона в процессе обучения. На тестовом стенде, имитирующем реалистичную эксплуатацию коллайдера, мы исследуем два репрезентативных триггера: триггер на полную поперечную энергию (H_{T}), чувствительный к изменению наложения событий, и триггер аномального детектирования (AD), основанный на ошибке реконструкции для редких или нестандартных сигнатур. На потоках Монте-Карло наш агент увеличивает долю временных интервалов, удовлетворяющих допуску, на 48% (H_T) и 28% (AD), с кумулятивным приростом до 2% в эффективности отбора сигнала на этих интервалах. При переносе с симуляции на реальные данные соударений (CMS Run 283408) тот же агент без дополнительной настройки достигает улучшения доли интервалов в допуске на 56% (H_T) и 28% (AD) по сравнению с базовыми методами, с дополнительным приростом эффективности сигнала по обоим триггерам. Насколько нам известно, это первая демонстрация управления триггерами на основе обучения с подкреплением на реальных данных соударений Большого адронного коллайдера. Код доступен по адресу https://github.com/Zixind/GFPO_LHC (см. репозиторий для получения подробной информации).
English
High-throughput scientific facilities such as the Large Hadron Collider depend on real-time event filtering (triggering) under tight constraints on bandwidth, latency, and storage. In practice, trigger menus are largely static and hand-tuned and can become suboptimal as detector conditions, pileup, and background composition drift over time. We cast online threshold tuning as a sequential decision-making problem: a reinforcement learning agent ingests streaming summaries of recent rates and signal-sensitive features and updates trigger thresholds to maximize signal efficiency while tracking a target background rate within a tolerance band. We adapt Group-Filtered Policy Optimization (GFPO) to streaming control and introduce two variants (GFPO-F, GFPO-FR) that enforce background rate feasibility during training. On a benchmark that emulates realistic collider operation, we study two representative triggers: a total transverse energy (H_{T}) trigger sensitive to pileup variation, and an anomaly-detection (AD) trigger based on reconstruction loss for rare or non-standard signatures. On Monte Carlo streams, our agent increases the fraction of in-tolerance time intervals by 48\% (H_T) and 28\% (AD), with a cumulative gain of up to 2\% in signal efficiency on those in-tolerance intervals. Transferring from simulation to real collision data (CMS Run 283408), the same agent, without fine-tuning, achieves a 56\% (H_T) and 28\% (AD) in-tolerance improvement over baselines, with further signal-efficiency gain on both triggers. To our knowledge, this is the first demonstration of RL-based trigger control on real Large Hadron Collider collision data. Code is available at https://github.com/Zixind/GFPO_LHC (see repo for details).