ChatPaper.aiChatPaper

Многопользовательские интерактивные модели мира с автоэнкодерами представлений

Multiplayer Interactive World Models with Representation Autoencoders

July 6, 2026
Авторы: Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar, Amélie Royer, Manu Orsini, Alyx Liao, Adam Jelley, Eloi Alonso, Florian Laurent, Fredrik Norén, James Swingos, Jan Hünermann, Kent Rollins, Lucas Hosseini, Matthieu Le Cauchois, Maxim Peter, Pim de Witte, Tim Brown, Vincent Micheli, Moritz Böhle, Gabriel de Marmiesse, Viktoriia Sharmanska, Lucia Specia, Michael Black, Patrick Pérez
cs.AI

Аннотация

Мы представляем первую многопользовательскую мировую модель для высокодинамичных сред, управляемых сложными физическими взаимодействиями. В то время как однопользовательские мировые модели рассматривают других агентов как часть среды, наша модель использует потоки действий нескольких агентов, обучаясь приписывать изменения в сцене правильному игроку и оставаться согласованной при произвольных комбинациях их действий. Мы изучаем эту проблему в игре Rocket League, где игроки соревнуются и сотрудничают в условиях быстрой, тесно связанной динамики. Обучившись на 10 000 часов игрового процесса, собранных с помощью общедоступных ботов, наша латентная диффузионная модель с 5 миллиардами параметров генерирует матчи с четырьмя игроками в реальном времени, выдавая 20 кадров в секунду на одном графическом процессоре Nvidia B200. Хотя модель обучена только на коротких клипах, ее развертывания остаются стабильными далеко за пределами горизонта обучения: качество распределения остается устойчивым вплоть до пяти минут — самого длинного горизонта, который мы измеряем, — и на практике мы наблюдаем, что развертывания продолжаются часами без признаков коллапса. Мы систематически исследуем ключевые проектные решения: видеокодек, генеративную цель и схему многопользовательского обусловливания. Кроме того, мы характеризуем, как поведение меняется с масштабом модели и данных, включая возникающие возможности и сохраняющиеся режимы сбоев. Кроме того, мы разрабатываем целевые оценки, которые исследуют физическое понимание модели, а не только визуальное качество. Чтобы поддержать дальнейшие исследования многопользовательских мировых моделей, мы публикуем наш набор данных, полную кодовую базу для обучения и инференса, а также живую демонстрацию.
English
We introduce the first multiplayer world model for highly dynamic environments governed by complex physical interactions. Whereas single-player world models treat the other agents as part of the environment, ours conditions on the action streams of multiple agents, learning to attribute changes in the scene to the correct player and to stay coherent under arbitrary combinations of their actions. We study this problem in the game of Rocket League, where players compete and cooperate under fast, tightly coupled dynamics. Trained on 10,000 hours of gameplay collected with publicly available bots, our 5-billion-parameter latent diffusion model generates four-player matches in real time, producing 20 frames per second on a single Nvidia B200 GPU. Although trained only on short clips, its rollouts stay stable far beyond the training horizon: distributional quality holds steady out to five minutes, the longest horizon we measure, and in practice we observe rollouts continuing for hours with no sign of collapse. We systematically investigate the central design choices: the video codec, the generative objective, and the multiplayer conditioning scheme. In addition, we characterize how behavior changes with model and data scale, including the capabilities that emerge and the failure modes that persist. We further develop targeted evaluations that probe the model's physical understanding rather than visual appearance alone. To support continued research on multiplayer world models, we release our dataset, our full training and inference codebase, and a live demo.