ChatPaper.aiChatPaper

Récompenser le processus scientifique : modélisation des récompenses au niveau du processus pour l'analyse de données agentique

Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis

April 27, 2026
Auteurs: Zhisong Qiu, Shuofei Qiao, Kewei Xu, Yuqi Zhu, Lun Du, Ningyu Zhang, Huajun Chen
cs.AI

Résumé

Les modèles de récompense de processus (PRM) ont obtenu un succès remarquable pour renforcer les capacités de raisonnement des grands modèles de langage (LLM) dans des domaines statiques comme les mathématiques. Cependant, leur potentiel dans les tâches d'analyse de données dynamiques reste sous-exploré. Dans ce travail, nous présentons d'abord une étude empirique révélant que les PRM généralistes peinent à superviser les agents d'analyse de données. Plus précisément, ils échouent à détecter les erreurs silencieuses, des défauts logiques produisant des résultats incorrects sans déclencher d'exceptions d'interpréteur, et pénalisent erronément les actions exploratoires, confondant l'exploration nécessaire par essais et erreurs avec des échecs d'ancrage. Pour combler cette lacune, nous présentons DataPRM, un nouveau modèle génératif de récompense de processus conscient de l'environnement qui (1) peut servir de vérificateur actif, interagissant de manière autonome avec l'environnement pour sonder les états d'exécution intermédiaires et détecter les erreurs silencieuses, et (2) utilise une stratégie de récompense ternaire tenant compte de la réflexion, qui distingue les erreurs d'ancrage corrigeables des fautes irrécupérables. Nous concevons un pipeline évolutif pour construire plus de 8 000 instances d'entraînement de haute qualité pour DataPRM via une génération de trajectoires axée sur la diversité et une annotation au niveau des étapes enrichie par la connaissance. Les résultats expérimentaux démontrent que DataPRM améliore les LLM politiques en aval de 7,21 % sur ScienceAgentBench et de 11,28 % sur DABStep en utilisant l'inférence Best-of-N. Notamment, avec seulement 4 milliards de paramètres, DataPRM surpasse les bases de référence solides et présente une généralisation robuste à travers diverses stratégies de mise à l'échelle au moment du test. De plus, l'intégration de DataPRM dans l'apprentissage par renforcement apporte des gains substantiels par rapport aux bases de référence de récompense basée sur les résultats, atteignant 78,73 % sur DABench et 64,84 % sur TableBench, validant ainsi l'efficacité de la supervision par récompense de processus. Le code est disponible à l'adresse https://github.com/zjunlp/DataMind.
English
Process Reward Models (PRMs) have achieved remarkable success in augmenting the reasoning capabilities of Large Language Models (LLMs) within static domains such as mathematics. However, their potential in dynamic data analysis tasks remains underexplored. In this work, we first present a empirical study revealing that general-domain PRMs struggle to supervise data analysis agents. Specifically, they fail to detect silent errors, logical flaws that yield incorrect results without triggering interpreter exceptions, and erroneously penalize exploratory actions, mistaking necessary trial-and-error exploration for grounding failures. To bridge this gap, we introduce DataPRM, a novel environment-aware generative process reward model that (1) can serve as an active verifier, autonomously interacting with the environment to probe intermediate execution states and uncover silent errors, and (2) employs a reflection-aware ternary reward strategy that distinguishes between correctable grounding errors and irrecoverable mistakes. We design a scalable pipeline to construct over 8K high-quality training instances for DataPRM via diversity-driven trajectory generation and knowledge-augmented step-level annotation. Experimental results demonstrate that DataPRM improves downstream policy LLMs by 7.21% on ScienceAgentBench and 11.28% on DABStep using Best-of-N inference. Notably, with only 4B parameters, DataPRM outperforms strong baselines, and exhibits robust generalizability across diverse Test-Time Scaling strategies. Furthermore, integrating DataPRM into Reinforcement Learning yields substantial gains over outcome-reward baselines, achieving 78.73% on DABench and 64.84% on TableBench, validating the effectiveness of process reward supervision. Code is available at https://github.com/zjunlp/DataMind.