ChatPaper.aiChatPaper

GeneralVLA-2: Reconstrução Ciente da Geometria e Memória Governada para Planejamento Robótico

GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning

June 16, 2026
Autores: Haoyu Wang, Guoqing Ma, Zeyu Zhang, Yandong Guo, Boxin Shi, Hao Tang
cs.AI

Resumo

Sistemas generalistas de visão-linguagem-ação necessitam de evidências 3D centradas em objetos e experiência de manipulação reutilizável para planejar trajetórias robóticas confiáveis. O GeneralVLA fornece uma interface hierárquica para converter linguagem e observações RGB-D em trajetórias 3D do efetuador final, mas dois gargalos persistem. Primeiro, a reconstrução monocular de objetos no estilo SAM3D pode alucinar pose e geometria não observada, enquanto a manipulação se beneficia de uma forma estável do objeto quando observações calibradas multivista estão disponíveis. Segundo, o KnowledgeBank original recupera principalmente trechos semanticamente similares e anexa novo conhecimento, o que dificulta o controle da qualidade da memória, conflitos, confiança e relevância geométrica. Para abordar o primeiro desafio, introduzimos o GeoFuse-MV3D, um ramo de reconstrução MV-SAM3D guiado por priori geométrica que verifica pistas geométricas externas com máscaras da vista de entrada, aplica suporte suave de casca visual, realiza refinamento por eixo e funde apenas a geometria, preservando a aparência. Para abordar o segundo desafio, atualizamos o KnowledgeBank para um sistema de memória de longo prazo governado, com metadados explícitos de qualidade, confiança, ciclo de vida, verificador e conflito, juntamente com recuperação orientada à precisão. Finalmente, avaliamos o ramo de reconstrução no GSO-30 e o módulo de memória no Terminal-Bench 2.0 e SWE-Bench Verified; o GeoFuse-MV3D melhora em relação à linha de base MV-SAM3D ao reduzir CD e LPIPS em 2,20% e 2,02%, enquanto aumenta PSNR e SSIM em 2,36% e 1,03%, e o KnowledgeBank melhora em relação ao ReasoningBank em 4,53% no SR do Terminal-Bench e 3,73% na taxa de resolução do SWE-Bench, ao mesmo tempo que reduz AS em 4,95% e 5,65%, respectivamente. Código: https://github.com/AIGeeksGroup/GeneralVLA-2. Site: https://aigeeksgroup.github.io/GeneralVLA-2.
English
Generalist vision-language-action systems need object-centric 3D evidence and reusable manipulation experience to plan reliable robot trajectories. GeneralVLA provides a hierarchical interface for converting language and RGB-D observations into 3D end-effector paths, but two bottlenecks remain. First, monocular SAM3D-style object reconstruction can hallucinate pose and unseen geometry, while manipulation benefits from stable object shape when calibrated multi-view observations are available. Second, the original KnowledgeBank mainly retrieves semantically similar snippets and appends new knowledge, which makes it difficult to control memory quality, conflicts, confidence, and geometric relevance. To address the first challenge, we introduce GeoFuse-MV3D, a geometry-prior-guided MV-SAM3D reconstruction branch that verifies external geometry cues with input-view masks, applies soft visual-hull support, performs axis-wise refinement, and fuses only geometry while preserving appearance. To address the second challenge, we upgrade KnowledgeBank into a governed long-term memory system with explicit quality, confidence, lifecycle, verifier, and conflict metadata, together with precision-oriented retrieval. Finally, we evaluate the reconstruction branch on GSO-30 and the memory module on Terminal-Bench 2.0 and SWE-Bench Verified; GeoFuse-MV3D improves over the MV-SAM3D baseline by reducing CD and LPIPS by 2.20% and 2.02% while increasing PSNR and SSIM by 2.36% and 1.03%, and KnowledgeBank improves over ReasoningBank by 4.53% on Terminal-Bench SR and 3.73% on SWE-Bench resolve rate, while reducing AS by 4.95% and 5.65%, respectively. Code: https://github.com/AIGeeksGroup/GeneralVLA-2. Website: https://aigeeksgroup.github.io/GeneralVLA-2.