Chat2Scenic: Ein iteratives RAG-basiertes Framework zur Szenariengenerierung im autonomen Fahren
Chat2Scenic: An Iterative RAG-Based Framework for Scenario Generation in Autonomous Driving
July 15, 2026
Autoren: Yuan Gao, Wenting Miao, Mattia Piccinini, Haoyu Wang, Qunying Song, Johannes Betz
cs.AI
Zusammenfassung
Die Validierung autonomer Fahrsysteme erfordert vielfältige, vorschriftskonforme Testszenarien. Im simulationsbasierten Testen werden Szenarien als ausführbare Skripte definiert. Die automatische Generierung solcher Skripte aus regulatorischen Beschreibungen bleibt jedoch eine offene Herausforderung, und bestehende Ansätze sind mit grundlegenden Zielkonflikten konfrontiert. Retrieval-Assemble-Methoden erzielen angemessene Kompilierungsraten, mangeln jedoch an Skalierbarkeit, während die Retrieval-basierte Vollskriptgenerierung unter niedrigen Kompilierungserfolgsraten leidet. Wir stellen Chat2Scenic vor, das erste iterative retrieval-gestützte Framework zur Generierung von Szenarioskripten in einer domänenspezifischen Sprache (DSL). Konkret bietet Chat2Scenic eine Chatbot-Schnittstelle, die eine interaktive Szenarienverfeinerung unterstützt und Retrieval-gestützte Generierung (RAG) integriert, um die Szenariengenerierung in regulatorischem Wissen und DSL-Syntax zu verankern. Darüber hinaus schlagen wir einen offenen Benchmark für die Szenariengenerierung vor, der 123 Szenarien aus verschiedenen Vorschriften umfasst, darunter NHTSA und UN-Fahrzeugvorschriften sowie andere Quellen. Eine umfassende Evaluierung mit hochmodernen Large Language Models (LLMs) zeigt, dass Chat2Scenic eine Kompilierungserfolgsrate (CSR) von 76,42 % und eine Framework-Genauigkeit (FA) von 58,17 % erreicht und damit bestehende Methoden übertrifft (Retrieval Assemble mit 30,08 % CSR und 11,03 % FA; Retrieval-Vollskriptgenerierung mit 16,26 % CSR und 10,86 % FA). Um zukünftige Forschung zu erleichtern, veröffentlichen wir unseren Code als Open Source unter https://github.com/TUM-AVS/chat2scenic.
English
Validating autonomous driving systems requires diverse, regulation-compliant test scenarios. In simulation-based testing, scenarios are defined as executable scripts. Yet automatically generating such scripts from regulatory descriptions remains an open challenge, and existing approaches face fundamental trade-offs. Retrieval-assemble methods achieve reasonable compilation rates but lack scalability, whereas retrieval-based full-script generation suffers from low compilation success rates. We present Chat2Scenic, the first iterative retrieval-augmented framework to generate scenario scripts in Domain Specific Language (DSL). Specifically, Chat2Scenic provides a chatbot interface that supports interactive scenario refinement and integrates Retrieval-augmented Generation (RAG) to ground scenario generation in regulatory knowledge and DSL syntax. Furthermore, we propose an open benchmark for scenario generation comprising 123 scenarios from various regulations, including NHTSA and United Nations Vehicle Regulations, as well as other sources. Extensive evaluation with State-of-the-Art (SOTA) Large Language Models (LLMs) demonstrates that Chat2Scenic achieves 76.42% Compilation Success Rate (CSR) and 58.17% Framework Accuracy (FA), outperforming existing methods (Retrieval Assemble with 30.08% CSR, 11.03% FA and Retrieval full script generation with 16.26% CSR, 10.86% FA). To facilitate future research, we release our code as open source at https://github.com/TUM-AVS/chat2scenic.