WorldLines: Benchmarking e Modelagem de Agentes Corporificados com Estado de Longo Horizonte
WorldLines: Benchmarking and Modeling Long-Horizon Stateful Embodied Agents
June 17, 2026
Autores: Yehang Zhang, Jianchong Su, Haojian Huang, Yifan Chang, Tianhao Zhou, Xinli Xu, Yingjie Xu, Yinchuan Li, Zexi Li, Ying-Cong Chen
cs.AI
Resumo
Para auxiliar humanos por períodos prolongados em lares reais, agentes incorporados precisam lembrar rotinas dos usuários, estados do mundo e interações passadas. Os benchmarks existentes de memória de longo prazo avaliam principalmente recuperação e resposta a perguntas centradas em linguagem, enquanto benchmarks incorporados frequentemente focam na execução de tarefas de curto horizonte sem testar o uso de memória de longo prazo em ambientes dinâmicos. Apresentamos WorldLines, um benchmark orientado a projetos para assistência doméstica incorporada de longo horizonte. Ele constrói trajetórias domésticas temporalmente estendidas com diálogos, ações, feedback de execução, mudanças de estado de objetos e dispositivos, e as converte em amostras vinculadas a evidências para QA de Memória e Planejamento de Tarefas Incorporadas. Propomos ainda ObsMem, uma estrutura de memória baseada em observador que mantém memórias cientes de visibilidade e trilhas de estado nativas de ação para decisões cientes de estado. Experimentos revelam desafios persistentes em observabilidade parcial, estados do mundo sobrescritos e tradução de memória de longo prazo em planos incorporados, enquanto ObsMem oferece uma arquitetura de referência mais robusta para esse cenário.
English
To assist humans over extended periods in real homes, embodied agents must remember user routines, world states, and past interactions. Existing long-term memory benchmarks mainly evaluate language-centric retrieval and question answering, while embodied benchmarks often focus on short-horizon task execution without testing long-term memory use in dynamic environments. We introduce WorldLines, a project-driven benchmark for long-horizon embodied household assistance. It constructs temporally extended household traces with dialogues, actions, execution feedback, object and device state changes, and converts them into evidence-linked samples for Memory QA and Embodied Task Planning. We further propose ObsMem, an observer-grounded memory framework that maintains visibility-aware memories and action-native state trails for state-aware decisions. Experiments reveal persistent challenges in partial observability, overwritten world states, and translating long-term memory into embodied plans, while ObsMem offers a stronger reference architecture for this setting.