Modelos de Mundo Interativos Multijogador com Autoencoders de Representação
Multiplayer Interactive World Models with Representation Autoencoders
July 6, 2026
Autores: Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar, Amélie Royer, Manu Orsini, Alyx Liao, Adam Jelley, Eloi Alonso, Florian Laurent, Fredrik Norén, James Swingos, Jan Hünermann, Kent Rollins, Lucas Hosseini, Matthieu Le Cauchois, Maxim Peter, Pim de Witte, Tim Brown, Vincent Micheli, Moritz Böhle, Gabriel de Marmiesse, Viktoriia Sharmanska, Lucia Specia, Michael Black, Patrick Pérez
cs.AI
Resumo
Apresentamos o primeiro modelo de mundo multijogador para ambientes altamente dinâmicos governados por interações físicas complexas. Enquanto os modelos de mundo para um único jogador tratam os outros agentes como parte do ambiente, o nosso condiciona-se nos fluxos de ação de múltiplos agentes, aprendendo a atribuir mudanças na cena ao jogador correto e a manter-se coerente sob combinações arbitrárias das suas ações. Estudamos este problema no jogo Rocket League, onde os jogadores competem e cooperam sob dinâmicas rápidas e fortemente acopladas. Treinado em 10.000 horas de jogo recolhidas com robôs disponíveis publicamente, o nosso modelo de difusão latente com 5 bilhões de parâmetros gera partidas de quatro jogadores em tempo real, produzindo 20 quadros por segundo numa única GPU Nvidia B200. Embora treinado apenas em pequenos excertos, as suas simulações permanecem estáveis muito além do horizonte de treino: a qualidade distribucional mantém-se constante até cinco minutos, o horizonte mais longo que medimos, e na prática observamos simulações a continuar por horas sem sinal de colapso. Investigamos sistematicamente as escolhas centrais de design: o codec de vídeo, o objetivo generativo e o esquema de condicionamento multijogador. Além disso, caracterizamos como o comportamento muda com a escala do modelo e dos dados, incluindo as capacidades que emergem e os modos de falha que persistem. Desenvolvemos adicionalmente avaliações direcionadas que investigam a compreensão física do modelo, em vez de apenas a aparência visual. Para apoiar a investigação contínua sobre modelos de mundo multijogador, disponibilizamos o nosso conjunto de dados, a nossa base de código completa para treino e inferência, e uma demonstração ao vivo.
English
We introduce the first multiplayer world model for highly dynamic environments governed by complex physical interactions. Whereas single-player world models treat the other agents as part of the environment, ours conditions on the action streams of multiple agents, learning to attribute changes in the scene to the correct player and to stay coherent under arbitrary combinations of their actions. We study this problem in the game of Rocket League, where players compete and cooperate under fast, tightly coupled dynamics. Trained on 10,000 hours of gameplay collected with publicly available bots, our 5-billion-parameter latent diffusion model generates four-player matches in real time, producing 20 frames per second on a single Nvidia B200 GPU. Although trained only on short clips, its rollouts stay stable far beyond the training horizon: distributional quality holds steady out to five minutes, the longest horizon we measure, and in practice we observe rollouts continuing for hours with no sign of collapse. We systematically investigate the central design choices: the video codec, the generative objective, and the multiplayer conditioning scheme. In addition, we characterize how behavior changes with model and data scale, including the capabilities that emerge and the failure modes that persist. We further develop targeted evaluations that probe the model's physical understanding rather than visual appearance alone. To support continued research on multiplayer world models, we release our dataset, our full training and inference codebase, and a live demo.