ChatPaper.aiChatPaper

Impliciete voorkeursafstemming voor menselijke beeldanimatie

Implicit Preference Alignment for Human Image Animation

May 8, 2026
Auteurs: Yuanzhi Wang, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Kai Yu, Tianxiang Zheng, Qinglin Lu, Zhen Cui
cs.AI

Samenvatting

De animatie van menselijke beelden heeft aanzienlijke vooruitgang geboekt, maar het genereren van hoogwaardige handbewegingen blijft een hardnekkige uitdaging vanwege hun hoge vrijheidsgraden en bewegingscomplexiteit. Hoewel versterkend leren op basis van menselijke feedback, met name directe preferentieoptimalisatie, een mogelijke oplossing biedt, vereist dit de constructie van strikte preferentieparen. Het samenstellen van dergelijke paren voor dynamische handregio's is echter buitengewoon kostbaar en vaak onpraktisch vanwege inconsistenties op frameniveau. In dit artikel stellen we Impliciete Preferentie Afstemming (IPA) voor, een data-efficiënt post-trainingsraamwerk dat de noodzaak van gepaarde preferentiegegevens elimineert. Theoretisch gefundeerd in impliciete beloningsmaximalisatie stemt IPA het model af door de waarschijnlijkheid van zelf gegenereerde hoogwaardige samples te maximaliseren, terwijl afwijkingen van de voorgetrainde prior worden bestraft. Verder introduceren we een Handbewuste Lokale Optimalisatiemechanisme om het afstemmingsproces expliciet naar handregio's te sturen. Experimenten tonen aan dat onze methode effectieve preferentieoptimalisatie bereikt om de kwaliteit van handgeneratie te verbeteren, terwijl de drempel voor het construeren van preferentiegegevens aanzienlijk wordt verlaagd. De code is beschikbaar op https://github.com/mdswyz/IPA.
English
Human image animation has witnessed significant advancements, yet generating high-fidelity hand motions remains a persistent challenge due to their high degrees of freedom and motion complexity. While reinforcement learning from human feedback, particularly direct preference optimization, offers a potential solution, it necessitates the construction of strict preference pairs. However, curating such pairs for dynamic hand regions is prohibitively expensive and often impractical due to frame-wise inconsistencies. In this paper, we propose Implicit Preference Alignment (IPA), a data-efficient post-training framework that eliminates the need for paired preference data. Theoretically grounded in implicit reward maximization, IPA aligns the model by maximizing the likelihood of self-generated high-quality samples while penalizing deviations from the pretrained prior. Furthermore, we introduce a Hand-Aware Local Optimization mechanism to explicitly steer the alignment process toward hand regions. Experiments demonstrate that our method achieves effective preference optimization to enhance hand generation quality, while significantly lowering the barrier for constructing preference data. Codes are released at https://github.com/mdswyz/IPA