ChatPaper.aiChatPaper

CtrlVTON: Prueba virtual controlable mediante segmentación por indicaciones de instancias visuales

CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation

July 10, 2026
Autores: Seungyong Lee, Hyun Jun Jang, Sangoh Kim, Sungjoon Park
cs.AI

Resumen

La prueba virtual de prendas (VTO) ha logrado avances significativos en la transferencia realista de prendas a una persona objetivo. Sin embargo, la mayoría de los sistemas otorgan al usuario un control limitado sobre cómo debe llevarse una prenda: su talla (holgada o ajustada), estilo (por ejemplo, metida por dentro o por fuera, abierta o cerrada) y colocación espacial sobre el cuerpo. Abordamos esta carencia con dos contribuciones complementarias. Primero, definimos y resolvemos la Segmentación por Instancia Visual Guiada por Indicaciones mediante VIP-SAM: dada una imagen en plano (flatlay) de una prenda, segmentar esa instancia específica en una fotografía de una persona que la lleva puesta. Se trata de una tarea a nivel de instancia, distinta de la segmentación a nivel de categoría típicamente estudiada. Segundo, presentamos CtrlVTON, un marco de VTO controlable que reformula la prueba como un problema de edición de imágenes y añade máscaras de segmentación como control a nivel de píxel sobre la disposición de la prenda, incluyendo estilo, talla y colocación espacial sobre el cuerpo. VIP-SAM y CtrlVTON alcanzan resultados de vanguardia en sus respectivas tareas. En particular, CtrlVTON genera imágenes que siguen las disposiciones proporcionadas por el usuario de manera mucho más fiel que los sistemas de edición propietarios más potentes, a la vez que iguala su fidelidad en la prenda.
English
Virtual try-on (VTO) has made significant progress in realistically transferring garments onto a target person. Yet most systems give the user little control over how a garment should be worn -- its size (loose or fitted), style (e.g., tucked in or untucked, open or closed), and spatial placement on the body. We address this gap with two complementary contributions. First, we define and solve Visual-Instance-Prompt Segmentation via VIP-SAM: given a flatlay image of a garment, segment that specific instance in a photograph of a person wearing it. This is an instance-level task, distinct from the typically studied category-level segmentation. Second, we introduce CtrlVTON, a controllable VTO framework that recasts try-on as an image editing problem and adds segmentation masks as pixel-level control over garment layout, including style, size, and spatial placement on the body. VIP-SAM and CtrlVTON each achieve state-of-the-art results on their respective tasks. In particular, CtrlVTON generates images that follow user-provided layouts far more faithfully than the strongest proprietary editing systems while matching them on garment fidelity.