ChatPaper.aiChatPaper

Uma Abordagem Híbrida para Reduzir a Lacuna de Aparência Sim2real em Conjuntos de Dados Sintéticos de Motor de Jogo

A Hybrid Approach for Closing the Sim2real Appearance Gap in Game Engine Synthetic Datasets

May 4, 2026
Autores: Stefanos Pasios
cs.AI

Resumo

Os motores de videojogos têm sido uma fonte importante para gerar grandes volumes de dados sintéticos visuais para treinar e avaliar algoritmos de visão computacional destinados a serem implementados no mundo real. Embora a fidelidade visual dos motores de jogos modernos tenha sido significativamente melhorada com tecnologias como o ray-tracing, persiste uma lacuna notável de aparência sim2real entre as imagens sintéticas e as do mundo real, o que limita a utilização de conjuntos de dados sintéticos em aplicações do mundo real. Nesta carta, investigamos a capacidade de um modelo de difusão de última geração para geração e edição de imagens (FLUX.2-4B Klein) para melhorar o fotorrealismo de conjuntos de dados sintéticos e comparamos o seu desempenho com um modelo tradicional de tradução imagem-a-imagem (REGEN). Além disso, propomos uma abordagem híbrida que combina as fortes transformações geométricas e de material dos métodos baseados em difusão com as capacidades de correspondência de distribuição das técnicas de tradução imagem-a-imagem. Através de experiências, demonstra-se que o REGEN supera o FLUX.2-4B Klein e que, ao combinar ambos os modelos FLUX.2-4B Klein e REGEN, pode ser alcançado um melhor realismo visual em comparação com a utilização individual de cada modelo, mantendo a consistência semântica. O código está disponível em: https://github.com/stefanos50/Hybrid-Sim2Real
English
Video game engines have been an important source for generating large volumes of visual synthetic datasets for training and evaluating computer vision algorithms that are to be deployed in the real world. While the visual fidelity of modern game engines has been significantly improved with technologies such as ray-tracing, a notable sim2real appearance gap between the synthetic and the real-world images still remains, which limits the utilization of synthetic datasets in real-world applications. In this letter, we investigate the ability of a state-of-the-art image generation and editing diffusion model (FLUX.2-4B Klein) to enhance the photorealism of synthetic datasets and compare its performance against a traditional image-to-image translation model (REGEN). Furthermore, we propose a hybrid approach that combines the strong geometry and material transformations of diffusion-based methods with the distribution-matching capabilities of image-to-image translation techniques. Through experiments, it is demonstrated that REGEN outperforms FLUX.2-4B Klein and that by combining both FLUX.2-4B Klein and REGEN models, better visual realism can be achieved compared to using each model individually, while maintaining semantic consistency. The code is available at: https://github.com/stefanos50/Hybrid-Sim2Real