ChatPaper.aiChatPaper

Modèles du monde interactifs multijoueurs avec autoencodeurs de représentation

Multiplayer Interactive World Models with Representation Autoencoders

July 6, 2026
Auteurs: Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar, Amélie Royer, Manu Orsini, Alyx Liao, Adam Jelley, Eloi Alonso, Florian Laurent, Fredrik Norén, James Swingos, Jan Hünermann, Kent Rollins, Lucas Hosseini, Matthieu Le Cauchois, Maxim Peter, Pim de Witte, Tim Brown, Vincent Micheli, Moritz Böhle, Gabriel de Marmiesse, Viktoriia Sharmanska, Lucia Specia, Michael Black, Patrick Pérez
cs.AI

Résumé

Nous présentons le premier modèle du monde multijoueur pour des environnements très dynamiques régis par des interactions physiques complexes. Alors que les modèles du monde mono-joueur traitent les autres agents comme faisant partie de l'environnement, le nôtre se conditionne sur les flux d'actions de plusieurs agents, apprenant à attribuer les changements dans la scène au bon joueur et à rester cohérent sous des combinaisons arbitraires de leurs actions. Nous étudions ce problème dans le jeu Rocket League, où les joueurs rivalisent et coopèrent dans une dynamique rapide et étroitement couplée. Entraîné sur 10 000 heures de jeu collectées avec des robots disponibles publiquement, notre modèle de diffusion latent à 5 milliards de paramètres génère des parties à quatre joueurs en temps réel, produisant 20 images par seconde sur un seul GPU Nvidia B200. Bien qu'entraîné uniquement sur de courts extraits, ses déploiements restent stables bien au-delà de l'horizon d'entraînement : la qualité distributionnelle se maintient jusqu'à cinq minutes, l'horizon le plus long que nous mesurons, et dans la pratique nous observons des déploiements se poursuivant pendant des heures sans signe d'effondrement. Nous étudions systématiquement les choix de conception centraux : le codec vidéo, l'objectif génératif et le schéma de conditionnement multijoueur. De plus, nous caractérisons comment le comportement évolue avec l'échelle du modèle et des données, y compris les capacités qui émergent et les modes de défaillance qui persistent. Nous développons également des évaluations ciblées qui sondent la compréhension physique du modèle plutôt que son seul aspect visuel. Pour soutenir la recherche continue sur les modèles du monde multijoueurs, nous publions notre ensemble de données, notre code complet d'entraînement et d'inférence, ainsi qu'une démonstration en direct.
English
We introduce the first multiplayer world model for highly dynamic environments governed by complex physical interactions. Whereas single-player world models treat the other agents as part of the environment, ours conditions on the action streams of multiple agents, learning to attribute changes in the scene to the correct player and to stay coherent under arbitrary combinations of their actions. We study this problem in the game of Rocket League, where players compete and cooperate under fast, tightly coupled dynamics. Trained on 10,000 hours of gameplay collected with publicly available bots, our 5-billion-parameter latent diffusion model generates four-player matches in real time, producing 20 frames per second on a single Nvidia B200 GPU. Although trained only on short clips, its rollouts stay stable far beyond the training horizon: distributional quality holds steady out to five minutes, the longest horizon we measure, and in practice we observe rollouts continuing for hours with no sign of collapse. We systematically investigate the central design choices: the video codec, the generative objective, and the multiplayer conditioning scheme. In addition, we characterize how behavior changes with model and data scale, including the capabilities that emerge and the failure modes that persist. We further develop targeted evaluations that probe the model's physical understanding rather than visual appearance alone. To support continued research on multiplayer world models, we release our dataset, our full training and inference codebase, and a live demo.