Odysseus: Escalando VLMs para Tomada de Decisão em 100+ Turnos em Jogos via Aprendizagem por Reforço
Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning
May 1, 2026
Autores: Chengshuai Shi, Wenzhe Li, Xinran Liang, Yizhou Lu, Wenjia Yang, Ruirong Feng, Seth Karten, Ziran Yang, Zihan Ding, Gabriel Sarch, Danqi Chen, Karthik Narasimhan, Chi Jin
cs.AI
Resumo
Dada a crescente capacidade dos modelos visuo-linguísticos (VLMs), a sua extensão para tarefas interativas de tomada de decisão, como videojogos, emergiu como uma fronteira promissora. No entanto, as abordagens existentes ou dependem de um ajuste fino supervisionado (SFT) em larga escala com trajetórias humanas, ou aplicam aprendizagem por reforço (RL) apenas em contextos de horizonte relativamente curto (tipicamente cerca de 20-30 turnos). Neste trabalho, estudamos o treino baseado em RL de VLMs para tomada de decisão de longo horizonte em Super Mario Land, um ambiente visual que requer mais de 100 turnos de interação com perceção, raciocínio e ação coordenados. Começamos com uma investigação sistemática dos componentes algorítmicos chave e propomos uma variante adaptada do PPO com um crítico leve ao nível do turno, que melhora substancialmente a estabilidade do treino e a eficiência amostral em comparação com métodos sem crítico, como GRPO e Reinforce++. Mostramos ainda que os VLMs pré-treinados fornecem fortes prioridades de ação, melhorando significativamente a eficiência amostral durante o treino de RL e reduzindo a necessidade de escolhas de design manual, como a engenharia de ações, em comparação com o RL clássico treinado a partir do zero. Com base nestes insights, introduzimos o Odysseus, um framework de treino aberto para agentes VLM, alcançando ganhos substanciais em múltiplas fases do jogo e um progresso médio no jogo pelo menos 3 vezes superior ao dos modelos de fronteira. Além disso, os modelos treinados exibem melhorias consistentes tanto em configurações de generalização dentro do jogo como entre jogos, mantendo ao mesmo tempo capacidades no domínio geral. No geral, os nossos resultados identificam ingredientes chave para tornar o RL estável e eficaz em configurações multimodais de longo horizonte e fornecem orientações práticas para o desenvolvimento de VLMs como agentes incorporados.
English
Given the rapidly growing capabilities of vision-language models (VLMs), extending them to interactive decision-making tasks such as video games has emerged as a promising frontier. However, existing approaches either rely on large-scale supervised fine-tuning (SFT) on human trajectories or apply reinforcement learning (RL) only in relatively short-horizon settings (typically around 20--30 turns). In this work, we study RL-based training of VLMs for long-horizon decision-making in Super Mario Land, a visually grounded environment requiring 100+ turns of interaction with coordinated perception, reasoning, and action. We begin with a systematic investigation of key algorithmic components and propose an adapted variant of PPO with a lightweight turn-level critic, which substantially improves training stability and sample efficiency over critic-free methods such as GRPO and Reinforce++. We further show that pretrained VLMs provide strong action priors, significantly improving sample efficiency during RL training and reducing the need for manual design choices such as action engineering, compared to classical deep RL trained from scratch. Building on these insights, we introduce Odysseus, an open training framework for VLM agents, achieving substantial gains across multiple levels of the game and at least 3 times average game progresses than frontier models. Moreover, the trained models exhibit consistent improvements under both in-game and cross-game generalization settings, while maintaining general-domain capabilities. Overall, our results identify key ingredients for making RL stable and effective in long-horizon, multi-modal settings, and provide practical guidance for developing VLMs as embodied agents.