CtrlVTON: Управляемая виртуальная примерка с помощью сегментации на основе визуально-объектных подсказок
CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation
July 10, 2026
Авторы: Seungyong Lee, Hyun Jun Jang, Sangoh Kim, Sungjoon Park
cs.AI
Аннотация
Виртуальная примерка (VTO) достигла значительных успехов в реалистичном переносе одежды на целевого человека. Однако большинство систем предоставляют пользователю мало контроля над тем, как должна носиться одежда — её размер (свободный или облегающий), фасон (например, заправленная или незаправленная, открытая или закрытая) и пространственное расположение на теле. Мы устраняем этот пробел с помощью двух взаимодополняющих вкладов. Во-первых, мы определяем и решаем задачу сегментации по визуальному примеру экземпляра (Visual-Instance-Prompt Segmentation) с помощью VIP-SAM: по изображению одежды в разложенном виде сегментировать конкретный экземпляр на фотографии человека, который её носит. Это задача на уровне экземпляра, отличная от типично изучаемой сегментации на уровне категорий. Во-вторых, мы представляем CtrlVTON — управляемую структуру VTO, которая переосмысливает примерку как задачу редактирования изображения и добавляет маски сегментации в качестве контроля на уровне пикселей над расположением одежды, включая фасон, размер и пространственное размещение на теле. VIP-SAM и CtrlVTON достигают передовых результатов в своих задачах. В частности, CtrlVTON генерирует изображения, которые следуют предоставленным пользователем макетам гораздо точнее, чем самые мощные проприетарные системы редактирования, при этом не уступая им в соответствии одежды.
English
Virtual try-on (VTO) has made significant progress in realistically transferring garments onto a target person. Yet most systems give the user little control over how a garment should be worn -- its size (loose or fitted), style (e.g., tucked in or untucked, open or closed), and spatial placement on the body. We address this gap with two complementary contributions. First, we define and solve Visual-Instance-Prompt Segmentation via VIP-SAM: given a flatlay image of a garment, segment that specific instance in a photograph of a person wearing it. This is an instance-level task, distinct from the typically studied category-level segmentation. Second, we introduce CtrlVTON, a controllable VTO framework that recasts try-on as an image editing problem and adds segmentation masks as pixel-level control over garment layout, including style, size, and spatial placement on the body. VIP-SAM and CtrlVTON each achieve state-of-the-art results on their respective tasks. In particular, CtrlVTON generates images that follow user-provided layouts far more faithfully than the strongest proprietary editing systems while matching them on garment fidelity.