Résultats et analyse rétrospective du défi AssetOpsBench de CODS 2025
Results and Retrospective Analysis of the CODS 2025 AssetOpsBench Challenge
May 8, 2026
Auteurs: Dhaval Patel, Chathurangi Shyalika, Suryanarayana Reddy Yarrabothula, Ling Yue, Shuxin Lin, Nianjun Zhou, James Rayfield
cs.AI
Résumé
Les rétrospectives de compétition sont utiles lorsqu'elles expliquent ce qu’un classement mesurait, comment l’évaluation cachée a modifié les conclusions et quels motifs de conception ont été récompensés. Nous revisitons le défi CODS 2025, une compétition Codabench respectueuse de la vie privée sur l’orchestration multi-agents industrielle construite sur . Nous combinons les feuilles de classement finales, un journal serveur de 300 soumissions, 149 inscriptions d’équipes, les exportations des meilleures soumissions, le rapport des organisateurs gagnants, l’article système compagnon et les arbres sources vérifiés du volet planification. Cinq résultats se dégagent. Premièrement, le classement public de planification sature à 72,73 %, et des consignes plus riches n’améliorent pas ce pic. Deuxièmement, l’évaluation cachée change la donne : les scores publics et privés corrèlent modérément en planification (r = 0,69) mais négativement en exécution (r = −0,13), plusieurs systèmes d’exécution publics à 45,45 % atteignant 63,64 % sur l’ensemble caché. Troisièmement, le terme est numériquement presque inerte dans le composite officiel — combiné sur une échelle de 0 à 1 avec des pourcentages de 0 à 100, il contribue au maximum 0,05 point par volet, et un rééchelonnement inverserait les deux premières équipes. Quatrièmement, la compétition est opérationnellement basée sur les comptes mais substantiellement basée sur les équipes : 149 équipes inscrites se réduisent à 24 avec des scores publics non nuls et 11 complètement classées, tandis que 52,3 % des inscriptions dédupliquées listent plusieurs noms d’utilisateurs. Cinquièmement, les méthodes d’exécution réussies améliorent surtout les garde-fous — sélection de réponses, nettoyage des contaminations, repli et contrôle du contexte — plutôt que des architectures d’agents novatrices. Ces résultats identifient les comportements que l’évaluation a récompensés et motivent l’utilisation de composites tenant compte de l’échelle, de diagnostics de niveau de compétence et de publication d’artefacts versionnés.
English
Competition retrospectives are useful when they explain what a leaderboard measured, how hidden evaluation changed conclusions, and which design patterns were rewarded. We revisit the CODS 2025 challenge, a privacy-aware Codabench competition on industrial multi-agent orchestration built on . We combine final rank sheets, a 300-submission server log, 149-team registrations, best-submission exports, the organizer winners report, the companion system paper, and verified planning-track source trees. Five results stand out. First, the public planning leaderboard saturates at 72.73\%, and richer prompts do not improve that peak. Second, hidden evaluation changes the story: public and private scores correlate moderately in planning (r{=}0.69) but negatively in execution (r{=}{-}0.13), with several 45.45\% public execution systems reaching 63.64\% on the hidden set. Third, the term is numerically almost inert in the official composite -- combined on a 0--1 scale with 0--100 percentage scores, it contributes at most 0.05 points per track, and rescaling would swap the top two teams. Fourth, the competition is operationally account-based but substantively team-based: 149 registered teams reduce to 24 with non-zero public scores and 11 fully ranked, while 52.3\% of deduplicated registrations list multiple usernames. Fifth, successful execution methods mostly improve guardrails -- response selection, contamination cleanup, fallback, and context control -- rather than novel agent architectures. These findings identify which behaviors the evaluation rewarded, and motivate scale-aware composites, skill-level diagnostics, and versioned artifact release.