ChatPaper.aiChatPaper

PAIWorld: Um Modelo de Fundação de Mundo Consistente em 3D para Manipulação Robótica

PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation

June 16, 2026
Autores: Yuhang Huang, Xuan Lv, Junyan Xu, Zhiyuan Yu, Jiazhao Zhang, Ruizhen Hu, Wancheng Feng, Shilong Zou, Hewen Xiao, Ziqiao Zhou, Kaiyun Huang, Zhiyu Peng, Juzhan Xu, Hang Zhao, Chenyang Zhu, Renjiao Yi, Yifei Huang, Douhui Wu, Yan Zhang, Kexu Cheng, Chunhe Song, Yunzhi Xue, Xiuhong Zhang, Leitao Guo, Yunji Chen, Bin Wu, Haibin Yu, Kai Xu
cs.AI

Resumo

Modelos de Base Mundial (WFMs) são simuladores poderosos, mas operam predominantemente em configuração de visão única e carecem da consistência 3D multivista necessária para a manipulação robótica. Embora os sistemas robóticos dependam de múltiplas câmeras (egocêntrica, olho-mão e montada no pulso) para o aprendizado de políticas, os atuais modelos de mundo multivista simplesmente concatenam tokens de vistas sem raciocínio geométrico explícito. Isso causa deriva de objetos entre vistas, inconsistência de profundidade e desalinhamento de textura. Atribuímos essas falhas a duas deficiências: a ausência de um mecanismo explícito de comunicação entre vistas e a falta de um prior geométrico 3D. Argumentamos que resolver ambas simultaneamente é necessário e suficiente. Para tal, apresentamos o PAIWorld, uma estrutura que aprimora modelos de mundo de difusão-transformador por meio de três componentes principais: (1) blocos de Atenção Cruzada entre Vistas com Conhecimento Geométrico, que estabelecem uma via explícita através das vistas; (2) Embedding de Posição Rotativa Geométrica, que codifica as direções dos raios da câmera e as posturas extrínsecas no mecanismo de atenção; e (3) REPA 3D Latente, que destila características com conhecimento 3D de modelos de base 3D congelados para garantir consistência 3D. Construído sobre um modelo de base mundial baseado em DiT, o PAIWorld alcança consistência 3D multivista de estado da arte em benchmarks de manipulação robótica, classificando-se em 1º lugar no ranking WorldArena e em 2º lugar no ranking AgiBot-Challenge2026, além de viabilizar aplicações posteriores, como planejamento baseado em modelos, modelos de ação mundial e pós-treinamento de políticas multivista.
English
World foundation models (WFMs) are powerful simulators, yet they predominantly operate in a single-view setting and lack the multi-view 3D consistency required for robotic manipulation. While robotic systems rely on multiple cameras (egocentric, eye-to-hand, and wrist-mounted) for policy learning, current multi-view world models simply concatenate view tokens without explicit geometric reasoning. This causes cross-view object drift, depth inconsistency, and texture misalignment. We trace these failures to two deficiencies: the absence of an explicit inter-view communication mechanism and the lack of a 3D geometric prior. We argue that resolving both simultaneously is necessary and sufficient. To address this, we present PAIWorld, a framework that augments diffusion-transformer world models via three core components: (1) Geometry-Aware Cross-View Attention blocks that establish an explicit pathway across views, (2) Geometric Rotary Position Embedding that encodes camera ray directions and extrinsic poses into the attention mechanism, and (3) Latent 3D-REPA, which distills 3D-aware features from frozen 3D foundation models to ensure 3D consistency. Built upon a DiT-based world foundation model, PAIWorld achieves state-of-the-art multi-view 3D consistency on robotic manipulation benchmarks, ranking 1st on the WorldArena leaderboard and 2nd on the AgiBot-Challenge2026 leaderboard, while enabling downstream applications such as model-based planning, world action models, and multi-view policy post-training.