Modelos de Valor do Mundo para Manipulação Robótica
World Value Models for Robotic Manipulation
June 23, 2026
Autores: Zhihao Wang, Jianxiong Li, Yu Cui, Yuan Gao, Xianyuan Zhan, Junzhi Yu, Xiao Ma
cs.AI
Resumo
Os modelos de valor generalistas desempenham um papel fundamental na escalabilidade da aprendizagem de políticas robóticas a partir de dados de qualidade mista em larga escala. Matematicamente, uma estimativa precisa de valor exige uma compreensão temporal profunda, exigindo que os modelos tanto fundamentem a crença atual usando o contexto histórico quanto planejem resultados futuros. No entanto, a maioria dos modelos de valor robóticos existentes é construída sobre bases de Modelos de Visão e Linguagem (VLM) pré-treinados principalmente em observações visuais estáticas ou temporalmente esparsas, carecendo das capacidades de modelagem temporal necessárias para a estimativa de valor. Ao contrário dos VLMs, os modelos de mundo naturalmente se destacam na modelagem temporal e no planejamento futuro, tornando-se bases ideais para aprender funções de valor generalizáveis. Impulsionados por essa percepção, unimos modelos de mundo à estimativa de valor para construir um novo modelo de valor robótico generalista, o World Value Model (WVM), que oferece progressões precisas de tarefas para avaliar a qualidade dos dados. Em benchmarks padrão, o WVM obtém resultados de Correlação de Ordem de Valor (VOC) de última geração (SOTA). Complementando os conjuntos de avaliação padrão que contêm apenas dados de especialistas, apresentamos ainda o Suboptimal-Value-Bench, um benchmark multi-embodiment composto por 800 trajetórias subótimas com anotações de quadros de alta fidelidade e rotuladas por humanos. Nossas avaliações mostram que o WVM mantém seu desempenho de última geração no Suboptimal-Value-Bench, estabelecendo sua robustez no manuseio de dados tanto de especialistas quanto subótimos. Quando implantado para aprendizagem de políticas, o WVM melhora o desempenho de manipulação em várias abordagens de extração de políticas, tanto em ambientes simulados quanto reais, fornecendo orientação robusta para o aprendizado a partir de dados de qualidade mista.
English
Generalist value models play a pivotal role in scaling robotic policy learning from large-scale, mixed-quality data. Mathematically, accurate value estimation demands deep temporal understanding, requiring models to both ground the current belief using historical context and plan over future outcomes. However, most existing robotic value models are built on Vision-Language Model (VLM) backbones that are pretrained primarily on static or temporally sparse visual observations, lacking the requisite temporal modeling capabilities for value estimation. Unlike VLMs, world models naturally excel at temporal modeling and future planning, making them ideal foundations for learning generalizable value functions. Driven by this insight, we marry world models with value estimation to construct a new generalist robotic value model, World Value Model (WVM), that offers accurate task progressions to assess data quality. On standard benchmarks, WVM delivers state-of-the-art (SOTA) Value-Order Correlation (VOC) results. Complementing standard evaluation suites that contains only expert data, we further introduce Suboptimal-Value-Bench, a multi-embodiment benchmark consisting of 800 suboptimal trajectories with high-fidelity, human-labeled frame annotations. Our evaluations show that WVM maintains its SOTA performance on Suboptimal-Value-Bench, establishing its robustness in handling both expert and suboptimal data. When deployed for policy learning, WVM improves manipulation performance across various policy extraction approaches in both simulated and real-world deployment, providing robust guidance for learning from mixed-quality data.