ChatPaper.aiChatPaper

CtrlVTON: Controleerbaar Virtueel Passen via Visuele-Instance-Prompt Segmentatie

CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation

July 10, 2026
Auteurs: Seungyong Lee, Hyun Jun Jang, Sangoh Kim, Sungjoon Park
cs.AI

Samenvatting

Virtueel passen (VTO) heeft aanzienlijke vooruitgang geboekt in het realistisch overbrengen van kledingstukken op een doelpersoon. Toch geven de meeste systemen de gebruiker weinig controle over hoe een kledingstuk gedragen moet worden – de maat (los of nauwsluitend), stijl (bijv. ingestopt of niet, open of dicht) en ruimtelijke plaatsing op het lichaam. We vullen deze leemte met twee complementaire bijdragen. Ten eerste definiëren en lossen we Visual-Instance-Prompt Segmentation via VIP-SAM op: gegeven een flatlay-afbeelding van een kledingstuk, segmenteer die specifieke instantie in een foto van een persoon die het draagt. Dit is een taak op instantieniveau, verschillend van de typisch bestudeerde segmentatie op categorieniveau. Ten tweede introduceren we CtrlVTON, een controleerbaar VTO-raamwerk dat passen herdefinieert als een beeldbewerkingsprobleem en segmentatiemaskers toevoegt als pixel-niveaucontrole over de lay-out van kleding, inclusief stijl, maat en ruimtelijke plaatsing op het lichaam. VIP-SAM en CtrlVTON behalen elk state-of-the-art resultaten op hun respectieve taken. In het bijzonder genereert CtrlVTON beelden die de door de gebruiker opgegeven lay-outs veel getrouwer volgen dan de sterkste propriëtaire bewerkingssystemen, terwijl het hen evenaart in kledinggetrouwheid.
English
Virtual try-on (VTO) has made significant progress in realistically transferring garments onto a target person. Yet most systems give the user little control over how a garment should be worn -- its size (loose or fitted), style (e.g., tucked in or untucked, open or closed), and spatial placement on the body. We address this gap with two complementary contributions. First, we define and solve Visual-Instance-Prompt Segmentation via VIP-SAM: given a flatlay image of a garment, segment that specific instance in a photograph of a person wearing it. This is an instance-level task, distinct from the typically studied category-level segmentation. Second, we introduce CtrlVTON, a controllable VTO framework that recasts try-on as an image editing problem and adds segmentation masks as pixel-level control over garment layout, including style, size, and spatial placement on the body. VIP-SAM and CtrlVTON each achieve state-of-the-art results on their respective tasks. In particular, CtrlVTON generates images that follow user-provided layouts far more faithfully than the strongest proprietary editing systems while matching them on garment fidelity.