ChatPaper.aiChatPaper

Prox-E: Edição de Malhas 3D de Alta Precisão por meio de Abstrações Baseadas em Primitivas

Prox-E: Fine-Grained 3D Shape Editing via Primitive-Based Abstractions

April 29, 2026
Autores: Etai Sella, Hao Phung, Nitay Amiel, Or Litany, Or Patashnik, Hadar Averbuch-Elor
cs.AI

Resumo

Os modelos de edição de imagens 2D baseados em texto atingiram recentemente um nível impressionante de maturidade, motivando um volume crescente de trabalhos que dependem fortemente desses modelos para impulsionar edições 3D. Embora sejam eficazes para modificações baseadas em aparência, esses pipelines de edição 3D centrados em 2D frequentemente lutam com a edição 3D de granularidade fina, onde mudanças estruturais localizadas devem ser aplicadas enquanto se preserva estritamente a identidade geral de um objeto. Para superar esta limitação, propomos o Prox-E, uma estrutura livre de treinamento que permite o controle 3D de granularidade fina por meio de uma abstração geométrica explícita baseada em primitivas. Nossa estrutura primeiro abstrai uma forma 3D de entrada em um conjunto compacto de primitivas geométricas. Um modelo de visão e linguagem (VLM) pré-treinado então edita essa abstração para especificar alterações a nível de primitiva. Essas edições estruturais são subsequentemente usadas para orientar um modelo generativo 3D, permitindo modificações localizadas e de granularidade fina, preservando as regiões inalteradas da forma original. Por meio de extensivos experimentos, demonstramos que nosso método equilibra consistentemente a preservação de identidade, a qualidade da forma e a fidelidade à instrução de forma mais eficaz do que várias abordagens existentes, incluindo editores 3D baseados em 2D e métodos baseados em treinamento.
English
Text-based 2D image editing models have recently reached an impressive level of maturity, motivating a growing body of work that heavily depends on these models to drive 3D edits. While effective for appearance-based modifications, such 2D-centric 3D editing pipelines often struggle with fine-grained 3D editing, where localized structural changes must be applied while strictly preserving an object's overall identity. To address this limitation, we propose Prox-E, a training-free framework that enables fine-grained 3D control through an explicit, primitive-based geometric abstraction. Our framework first abstracts an input 3D shape into a compact set of geometric primitives. A pretrained vision-language model (VLM) then edits this abstraction to specify primitive-level changes. These structural edits are subsequently used to guide a 3D generative model, enabling fine-grained, localized modifications while preserving unchanged regions of the original shape. Through extensive experiments, we demonstrate that our method consistently balances identity preservation, shape quality, and instruction fidelity more effectively than various existing approaches, including 2D-based 3D editors and training-based methods.