QuantCode-Bench : Un benchmark pour évaluer la capacité des grands modèles de langage à générer des stratégies de trading algorithmique exécutables
QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies
April 16, 2026
Auteurs: Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich
cs.AI
Résumé
Les grands modèles de langage ont démontré de solides performances sur les tâches de programmation générales, mais leur capacité à générer des stratégies de trading algorithmique exécutables reste peu explorée. Contrairement aux benchmarks de code standard, la génération de stratégies de trading nécessite la maîtrise simultanée d'une logique financière spécifique au domaine, la connaissance d'une API spécialisée et la capacité à produire un code non seulement syntaxiquement correct, mais aussi conduisant à des transactions réelles sur des données historiques. Dans ce travail, nous présentons QuantCode-Bench, un benchmark pour l'évaluation systématique des LLM modernes dans la génération de stratégies pour le framework Backtrader à partir de descriptions textuelles en anglais. Le benchmark contient 400 tâches de difficulté variable collectées sur Reddit, TradingView, StackExchange, GitHub et des sources synthétiques. L'évaluation est menée via un pipeline multi-étapes qui vérifie la correction syntaxique, l'exécution réussie du backtest, la présence de transactions et l'alignement sémantique avec la description de la tâche à l'aide d'un LLM juge. Nous comparons des modèles de pointe dans deux configurations : en mode single-turn, où la stratégie doit être générée correctement dès le premier essai, et en mode agentique multi-tours, où le modèle reçoit un feedback itératif et peut corriger ses erreurs. Nous analysons les modes d'échec à travers les différentes étapes du pipeline et montrons que les principales limitations des modèles actuels ne sont pas liées à la syntaxe, mais plutôt à la correcte opérationnalisation de la logique de trading, à l'usage approprié de l'API et au respect de la sémantique de la tâche. Ces résultats suggèrent que la génération de stratégies de trading constitue une classe distincte de tâches de génération de code spécifique à un domaine dans laquelle la réussite nécessite non seulement une exactitude technique, mais aussi un alignement entre les descriptions en langage naturel, la logique financière et le comportement observable de la stratégie sur les données.
English
Large language models have demonstrated strong performance on general-purpose programming tasks, yet their ability to generate executable algorithmic trading strategies remains underexplored. Unlike standard code benchmarks, trading-strategy generation requires simultaneous mastery of domain-specific financial logic, knowledge of a specialized API, and the ability to produce code that is not only syntactically correct but also leads to actual trades on historical data. In this work, we present QuantCode-Bench, a benchmark for the systematic evaluation of modern LLMs in generating strategies for the Backtrader framework from textual descriptions in English. The benchmark contains 400 tasks of varying difficulty collected from Reddit, TradingView, StackExchange, GitHub, and synthetic sources. Evaluation is conducted through a multi-stage pipeline that checks syntactic correctness, successful backtest execution, the presence of trades, and semantic alignment with the task description using an LLM judge. We compare state-of-the-art models in two settings: single-turn, where the strategy must be generated correctly on the first attempt, and agentic multi-turn, where the model receives iterative feedback and may repair its errors. We analyze the failure modes across different stages of the pipeline and show that the main limitations of current models are not related to syntax, but rather to the correct operationalization of trading logic, proper API usage, and adherence to task semantics. These findings suggest that trading strategy generation constitutes a distinct class of domain-specific code generation tasks in which success requires not only technical correctness, but also alignment between natural-language descriptions, financial logic, and the observable behavior of the strategy on data.