Um Estudo de Caso Exploratório de Refatoração Assistida por LLM e Geração de Funcionalidades de Jogabilidade em um Jogo de Corrida Infinita
An Exploratory Case Study of LLM-Assisted Refactoring and Gameplay Feature Generation in an Endless Runner Game
June 19, 2026
Autores: Jan Wunderlich, Markus Kleffmann, Sebastian Lempert
cs.AI
Resumo
Grandes modelos de linguagem (LLMs) são cada vez mais utilizados para apoiar o desenvolvimento de software, mas sua utilidade prática em contextos aplicados de desenvolvimento de jogos permanece pouco explorada, especialmente quando o código gerado precisa ser integrado a um sistema de software de jogo existente. Este artigo apresenta um estudo de caso empírico exploratório do GPT-4o em um corredor infinito personalizado em Python/Pygame. O estudo examina seis tarefas de desenvolvimento selecionadas: três tarefas de refatoração localizada e três tarefas envolvendo geração de funcionalidades de jogabilidade. As implementações resultantes foram avaliadas por meio de métricas de software, testes unitários e avaliações manuais de jogabilidade. Neste estudo de caso, todas as três tarefas de refatoração selecionadas foram concluídas com sucesso em termos funcionais, enquanto apenas uma das três tarefas de geração de funcionalidades de jogabilidade resultou em uma funcionalidade corretamente integrada. Os resultados sugerem que, neste contexto, o GPT-4o lidou com transformações localizadas de forma mais confiável do que com tarefas que exigiam novas interações de jogabilidade entre múltiplos sistemas existentes. Dado o delineamento exploratório de caso único, esses resultados são melhor interpretados como observações indicativas, e não como evidência generalizável do desempenho do modelo em nível de categoria. No geral, o artigo contribui com um relato transparente baseado em caso sobre as oportunidades e limitações da refatoração assistida por LLM e da geração de funcionalidades de jogabilidade em um sistema de software de jogo existente.
English
Large language models (LLMs) are increasingly used to support software development, but their practical usefulness in applied game-development settings remains underexplored, especially when generated code must be integrated into an existing game software system. This paper presents an exploratory empirical case study of GPT-4o in a custom Python/Pygame endless runner. The study examines six selected development tasks: three localized refactoring tasks and three tasks involving gameplay feature generation. The resulting implementations were evaluated using software metrics, unit tests, and manual gameplay assessments. In this case study, all three selected refactoring tasks were completed successfully in functional terms, whereas only one of the three selected gameplay feature generation tasks resulted in a correctly integrated feature. The findings suggest that, in this setting, GPT-4o handled localized transformations more reliably than tasks requiring new gameplay interactions across multiple existing systems. Given the exploratory single-case design, these results are best interpreted as indicative observations rather than as generalizable evidence of category-level model performance. Overall, the paper contributes a transparent case-based account of the opportunities and limitations of LLM-assisted refactoring and gameplay feature generation in an existing game software system.