Arbor: Condicionamento Geométrico Explícito para Geração Controlável de Ativos 3D
Arbor: Explicit Geometric Conditioning for Controllable 3D Asset Generation
June 22, 2026
Autores: Jan-Niklas Dihlmann, Andreas Engelhardt, Simon Donne, Hendrik P. A. Lensch, Mark Boss
cs.AI
Resumo
Modelos 3D condicionados por texto e imagem agora geram ativos convincentes, mas ainda oferecem pouco controle direto sobre o espaço que um objeto deve ocupar ou evitar. Na autoria, essa intenção espacial é frequentemente conhecida antes do início da geração. Uma cadeira deve se encaixar em um envelope de assento, um adereço deve deixar espaço para movimento, ou uma peça deve expor uma superfície de contato. Prompts e visualizações de imagem são veículos inadequados para tais restrições, exigindo a necessidade de uma interface de controle explícita.
Apresentamos o Arbor, um anexo treinável para geração 3D latente condicionada por texto. O Arbor introduz malhas de restrição como uma interface de controle 3D nativa. A interface utiliza regiões de envoltória onde a geometria deve existir, regiões de evitação que devem permanecer vazias e regiões de toque que o objeto deve contactar. Diferentemente de preenchimento ou controle de arcabouço de objeto inteiro, essas malhas não são evidências-alvo. Elas são requisitos locais tipificados e podem incluir regiões onde nenhuma superfície deve aparecer. O Arbor mantém esse sinal como geometria, convertendo malhas de restrição em tokens e aprendendo um anexo roteado dentro de um desruificador congelado. Cada região latente pode, portanto, receber a parte da restrição relevante para sua localização espacial.
Avaliamos o Arbor em benchmarks de controle automáticos e com curadoria artística, utilizando restrições de envoltória, evitação e toque, e comparamos as tendências métricas com um estudo de preferência do usuário. Mesmo sem perdas dedicadas de conformidade, o Arbor melhora a obediência às restrições, preservando a qualidade e a variação do objeto sob restrições fixas.
English
Text and image conditioned 3D models now generate convincing assets, but they still offer little direct control over the space an object should occupy or avoid. In authoring, this spatial intent is often known before generation starts. A chair should fit a seating envelope, a prop should leave clearance for motion, or a part should expose a contact surface. Prompts and image views are poor carriers for such constraints, requiring the need for an explicit control interface.
We present Arbor, a trainable attachment for text conditioned latent 3D generation. Arbor introduces constraint meshes as a native 3D control interface. The interface uses hull regions where geometry should exist, avoidance regions that should remain empty, and touch regions the object should contact. Unlike completion or whole object scaffold control, these meshes are not target evidence. They are local typed requirements and can include regions where no surface should appear. Arbor keeps this signal as geometry by converting constraint meshes into tokens and learning a routed attachment inside a frozen denoiser. Each latent region can therefore receive the part of the constraint that matters for its spatial location.
We evaluate Arbor on automatic and artist curated control benchmarks with hull, avoidance, and touch constraints, and compare the metric trends to a user preference study. Even without dedicated compliance losses, Arbor improves constraint obedience while preserving object quality and variation under fixed constraints.