ChatPaper.aiChatPaper

Meerspeler Interactieve Wereldmodellen met Representatie-Autoencoders

Multiplayer Interactive World Models with Representation Autoencoders

July 6, 2026
Auteurs: Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar, Amélie Royer, Manu Orsini, Alyx Liao, Adam Jelley, Eloi Alonso, Florian Laurent, Fredrik Norén, James Swingos, Jan Hünermann, Kent Rollins, Lucas Hosseini, Matthieu Le Cauchois, Maxim Peter, Pim de Witte, Tim Brown, Vincent Micheli, Moritz Böhle, Gabriel de Marmiesse, Viktoriia Sharmanska, Lucia Specia, Michael Black, Patrick Pérez
cs.AI

Samenvatting

We introduceren het eerste multiplayer-wereldmodel voor zeer dynamische omgevingen die worden beheerst door complexe fysieke interacties. Waar single-player-wereldmodellen de andere agenten als onderdeel van de omgeving beschouwen, conditioneert het onze op de actiestromen van meerdere agenten, waarbij het leert om veranderingen in de scène aan de juiste speler toe te schrijven en coherent te blijven onder willekeurige combinaties van hun acties. We bestuderen dit probleem in het spel Rocket League, waar spelers concurreren en samenwerken onder snelle, nauw gekoppelde dynamiek. Getraind op 10.000 uur aan speeltijd verzameld met openbaar beschikbare bots, genereert ons 5-miljard-parameter latente diffusiemodel vier-speler-wedstrijden in realtime, met 20 frames per seconde op een enkele Nvidia B200 GPU. Hoewel het alleen getraind is op korte clips, blijven de rollouts ver buiten de trainingshorizon stabiel: de distributionele kwaliteit blijft stabiel tot vijf minuten, de langste horizon die we meten, en in de praktijk zien we rollouts die uren doorgaan zonder tekenen van instorting. We onderzoeken systematisch de centrale ontwerpkeuzes: de videocodec, het generatieve doel en het multiplayer-conditioneringsschema. Daarnaast karakteriseren we hoe gedrag verandert met model- en dataschaal, inclusief de vermogens die ontstaan en de faalwijzen die aanhouden. We ontwikkelen verder gerichte evaluaties die het fysieke begrip van het model onderzoeken in plaats van alleen visuele verschijning. Om verder onderzoek aan multiplayer-wereldmodellen te ondersteunen, geven we onze dataset, onze volledige trainings- en inferentiecodebase en een live demo vrij.
English
We introduce the first multiplayer world model for highly dynamic environments governed by complex physical interactions. Whereas single-player world models treat the other agents as part of the environment, ours conditions on the action streams of multiple agents, learning to attribute changes in the scene to the correct player and to stay coherent under arbitrary combinations of their actions. We study this problem in the game of Rocket League, where players compete and cooperate under fast, tightly coupled dynamics. Trained on 10,000 hours of gameplay collected with publicly available bots, our 5-billion-parameter latent diffusion model generates four-player matches in real time, producing 20 frames per second on a single Nvidia B200 GPU. Although trained only on short clips, its rollouts stay stable far beyond the training horizon: distributional quality holds steady out to five minutes, the longest horizon we measure, and in practice we observe rollouts continuing for hours with no sign of collapse. We systematically investigate the central design choices: the video codec, the generative objective, and the multiplayer conditioning scheme. In addition, we characterize how behavior changes with model and data scale, including the capabilities that emerge and the failure modes that persist. We further develop targeted evaluations that probe the model's physical understanding rather than visual appearance alone. To support continued research on multiplayer world models, we release our dataset, our full training and inference codebase, and a live demo.