ChatPaper.aiChatPaper

Modelagem do Mundo em Contexto para Controle Robótico

In-Context World Modeling for Robotic Control

June 25, 2026
Autores: Siyin Wang, Junhao Shi, Senyu Fei, Zhaoyang Fu, Li Ji, Jingjing Gong, Xipeng Qiu
cs.AI

Resumo

Modelos modernos de Visão-Linguagem-Ação (VLA) frequentemente falham em generalizar para novas configurações, como pontos de vista alterados da câmera ou morfologias do robô, pois são tipicamente condicionados apenas a observações atuais e instruções em linguagem. Ao ignorar a configuração subjacente do sistema como uma variável, esses modelos assumem implicitamente um contexto de execução fixo encontrado durante o treinamento, necessitando de ajuste fino intensivo em dados para qualquer novo ambiente. Neste trabalho, introduzimos a Modelagem de Mundo no Contexto (In-Context World Modeling, ICWM), uma estrutura que trata a identificação do sistema como um problema de adaptação no contexto. O ICWM permite que políticas de robôs infiram autonomamente variáveis essenciais do sistema a partir de um breve histórico de interações autogeradas e independentes de tarefa. Diferentemente da Aprendizagem no Contexto tradicional, que usa demonstrações para especificar qual tarefa realizar, o ICWM aproveita a janela de contexto para entender como o sistema opera. Ao processar essas interações antes da execução da tarefa, o modelo captura implicitamente as dinâmicas do mundo do sistema atual, permitindo adaptação a novas configurações sem atualizações de parâmetros. Experimentos extensivos em simulação e em plataformas robóticas reais demonstram que o ICWM supera significativamente as linhas de base VLA padrão em novos pontos de vista da câmera.
English
Modern Vision-Language-Action (VLA) models often fail to generalize to novel setups, such as altered camera viewpoints or robot morphologies, because they are typically conditioned only on current observations and language instructions. By ignoring the underlying system configuration as a variable, these models implicitly assume a fixed execution context encountered during training, necessitating data-intensive fine-tuning for any new environment. In this work, we introduce In-Context World Modeling (ICWM), a framework that treats system identification as an in-context adaptation problem. ICWM enables robot policies to autonomously infer essential system variables from a short history of self-generated, task-agnostic interactions. Unlike traditional In-Context Learning that uses demonstrations to specify what task to perform, ICWM leverages the context window to understand how the system operates. By processing these interactions before task execution, the model implicitly captures the world dynamics of the current system, enabling adaptation to novel configurations without parameter updates. Extensive experiments in simulation and on real-world robot platforms demonstrate that ICWM significantly outperforms standard VLA baselines on novel camera viewpoints.