EBench: Diagnóstico Elementar de Políticas Generalistas de Manipulação Móvel
EBench: Elemental Diagnosis of Generalist Mobile Manipulation Policies
June 20, 2026
Autores: Ning Gao, Jinliang Zheng, Xing Gao, Haoxiang Ma, Hanqing Wang, Yukai Wang, Jiantong Chen, Zanxin Chen, Shujie Zhang, Mingda Jia, Xuekun Jiang, Zihou Zhu, Xinyu Li, Shuai Wang, Hao Li, Wenzhe Cai, Yuqiang Yang, Xudong Xu, Zhaoyang Lyu, Yao Mu, Tai Wang, Jiangmiao Pang, Jia Zeng, Weinan Zhang, Chunhua Shen
cs.AI
Resumo
Apresentamos o EBench, um benchmark de simulação que diagnostica políticas generalistas de manipulação móvel para além de um único escalar de taxa de sucesso. O EBench compreende 26 tarefas de manipulação diversas e desafiadoras, anotadas ao longo de 5 dimensões de capacidade e 4 dimensões de generalização. Avaliamos modelos de manipulação generalista de estado da arte, incluindo π₀, π₀,₅, XVLA e InternVLA-A1, e revelamos que modelos com taxas de sucesso próximas exibem perfis de capacidade notoriamente distintos: π₀,₅ atinge a maior taxa de sucesso nos testes e a melhor retenção treino-teste, enquanto o InternVLA-A1 domina a manipulação móvel, mas colapsa em tarefas dextras, e o XVLA apresenta pontos fortes em um conjunto disjunto de habilidades atômicas em comparação com outras políticas. Além da definição de perfis de capacidade, o EBench analisa a habilidade de generalização a partir de 4 perspectivas representativas, identificando o impacto de diferentes fatores de mudança de distribuição. Os resultados revelam pontos fortes e fracos dos modelos por trás de uma pontuação geral. Esperamos que este benchmark ofereça um amplo conjunto de sinais diagnósticos para orientar a iteração em modelos generalistas de manipulação.
English
We present EBench, a simulation benchmark that diagnoses generalist mobile manipulation policies beyond a single success-rate scalar. EBench comprises 26 diverse and challenging manipulation tasks annotated along 5 capability dimensions and 4 generalization dimensions. We evaluate state-of-the-art generalist manipulation models including π_0, π_{0.5}, XVLA, and InternVLA-A1, and reveal that models with near success rates exhibit strikingly different capability profiles: π_{0.5} achieves the highest test success rate and the best train--test retention, whereas InternVLA-A1 dominates mobile manipulation but collapses on dexterous tasks, and XVLA exhibits strengths on a disjoint set of atomic skills compared to other policies. Beyond capability profiling, EBench analyzes the generalization ability from 4 representative perspectives, identifying the impact of different distribution shift factors. The results reveal strengths and weaknesses of models behind an overall score. We hope this benchmark offers a broad set of diagnostic signals to guide iteration on generalist manipulation models.