PixelSmile: Op Weg Naar Gedetailleerde Bewerking van Gezichtsuitdrukkingen
PixelSmile: Toward Fine-Grained Facial Expression Editing
March 26, 2026
Auteurs: Jiabin Hua, Hengyuan Xu, Aojie Li, Wei Cheng, Gang Yu, Xingjun Ma, Yu-Gang Jiang
cs.AI
Samenvatting
Fijngranulaire gezichtsuitdrukkingsbewerking wordt al lang beperkt door intrinsieke semantische overlap. Om dit aan te pakken, construeren we de Flex Facial Expression (FFE)-dataset met continue affectieve annotaties en stellen we FFE-Bench op om structurele verwarring, bewerkingsnauwkeurigheid, lineaire bestuurbaarheid en de afweging tussen expressiebewerking en identiteitsbehoud te evalueren. Wij stellen PixelSmile voor, een diffusieraamwerk dat expressiesemantiek ontwart via volledig symmetrische gezamenlijke training. PixelSmile combineert intensiteitstoezicht met contrastief leren om sterkere en beter onderscheidbare expressies te produceren, en bereikt precieze en stabiele lineaire expressiecontrole door tekstuele latente interpolatie. Uitgebreide experimenten tonen aan dat PixelSmile superieure ontwarring en robuuste identiteitsbehoud bereikt, wat de effectiviteit bevestigt voor continue, bestuurbare en fijngranulaire expressiebewerking, terwijl het naadloos vloeiende expressiemenging ondersteunt.
English
Fine-grained facial expression editing has long been limited by intrinsic semantic overlap. To address this, we construct the Flex Facial Expression (FFE) dataset with continuous affective annotations and establish FFE-Bench to evaluate structural confusion, editing accuracy, linear controllability, and the trade-off between expression editing and identity preservation. We propose PixelSmile, a diffusion framework that disentangles expression semantics via fully symmetric joint training. PixelSmile combines intensity supervision with contrastive learning to produce stronger and more distinguishable expressions, achieving precise and stable linear expression control through textual latent interpolation. Extensive experiments demonstrate that PixelSmile achieves superior disentanglement and robust identity preservation, confirming its effectiveness for continuous, controllable, and fine-grained expression editing, while naturally supporting smooth expression blending.