Modelos del Mundo Interactivos Multijugador con Autoencoders de Representación
Multiplayer Interactive World Models with Representation Autoencoders
July 6, 2026
Autores: Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar, Amélie Royer, Manu Orsini, Alyx Liao, Adam Jelley, Eloi Alonso, Florian Laurent, Fredrik Norén, James Swingos, Jan Hünermann, Kent Rollins, Lucas Hosseini, Matthieu Le Cauchois, Maxim Peter, Pim de Witte, Tim Brown, Vincent Micheli, Moritz Böhle, Gabriel de Marmiesse, Viktoriia Sharmanska, Lucia Specia, Michael Black, Patrick Pérez
cs.AI
Resumen
Presentamos el primer modelo de mundo multijugador para entornos altamente dinámicos regidos por interacciones físicas complejas. Mientras que los modelos de mundo para un solo jugador tratan a los otros agentes como parte del entorno, el nuestro se condiciona a los flujos de acciones de múltiples agentes, aprendiendo a atribuir los cambios en la escena al jugador correcto y a mantenerse coherente bajo combinaciones arbitrarias de sus acciones. Estudiamos este problema en el juego Rocket League, donde los jugadores compiten y cooperan bajo dinámicas rápidas y estrechamente acopladas. Entrenado con 10 000 horas de juego recopiladas con bots disponibles públicamente, nuestro modelo de difusión latente de 5 mil millones de parámetros genera partidas de cuatro jugadores en tiempo real, produciendo 20 fotogramas por segundo en una única GPU Nvidia B200. Aunque entrenado únicamente con fragmentos cortos, sus despliegues se mantienen estables mucho más allá del horizonte de entrenamiento: la calidad distribucional se sostiene constante hasta cinco minutos, el horizonte más largo que medimos, y en la práctica observamos despliegues que continúan durante horas sin señales de colapso. Investigamos sistemáticamente las decisiones de diseño centrales: el códec de video, el objetivo generativo y el esquema de condicionamiento multijugador. Además, caracterizamos cómo cambia el comportamiento con la escala del modelo y los datos, incluyendo las capacidades que emergen y los modos de fallo que persisten. Desarrollamos además evaluaciones específicas que indagan en la comprensión física del modelo, más allá de la apariencia visual. Para apoyar la investigación continua sobre modelos de mundo multijugador, publicamos nuestro conjunto de datos, nuestro código completo de entrenamiento e inferencia, y una demostración en vivo.
English
We introduce the first multiplayer world model for highly dynamic environments governed by complex physical interactions. Whereas single-player world models treat the other agents as part of the environment, ours conditions on the action streams of multiple agents, learning to attribute changes in the scene to the correct player and to stay coherent under arbitrary combinations of their actions. We study this problem in the game of Rocket League, where players compete and cooperate under fast, tightly coupled dynamics. Trained on 10,000 hours of gameplay collected with publicly available bots, our 5-billion-parameter latent diffusion model generates four-player matches in real time, producing 20 frames per second on a single Nvidia B200 GPU. Although trained only on short clips, its rollouts stay stable far beyond the training horizon: distributional quality holds steady out to five minutes, the longest horizon we measure, and in practice we observe rollouts continuing for hours with no sign of collapse. We systematically investigate the central design choices: the video codec, the generative objective, and the multiplayer conditioning scheme. In addition, we characterize how behavior changes with model and data scale, including the capabilities that emerge and the failure modes that persist. We further develop targeted evaluations that probe the model's physical understanding rather than visual appearance alone. To support continued research on multiplayer world models, we release our dataset, our full training and inference codebase, and a live demo.