Alinhamento Implícito de Preferências para Animação de Imagens Humanas
Implicit Preference Alignment for Human Image Animation
May 8, 2026
Autores: Yuanzhi Wang, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Kai Yu, Tianxiang Zheng, Qinglin Lu, Zhen Cui
cs.AI
Resumo
A animação de imagens humanas tem testemunhado avanços significativos, mas gerar movimentos de mãos com alta fidelidade continua sendo um desafio persistente devido aos seus altos graus de liberdade e complexidade de movimento. Embora o aprendizado por reforço a partir de feedback humano, particularmente a otimização direta de preferência, ofereça uma solução potencial, ele exige a construção de pares de preferência estritos. No entanto, selecionar tais pares para regiões dinâmicas das mãos é proibitivamente caro e muitas vezes impraticável devido a inconsistências quadro a quadro. Neste artigo, propomos o Alinhamento Implícito de Preferência (IPA), uma estrutura pós-treinamento eficiente em termos de dados que elimina a necessidade de dados de preferência pareados. Fundamentado teoricamente na maximização implícita de recompensa, o IPA alinha o modelo maximizando a verossimilhança de amostras de alta qualidade autogeradas, enquanto penaliza desvios do prior pré-treinado. Além disso, introduzimos um mecanismo de Otimização Local Consciente da Mão para direcionar explicitamente o processo de alinhamento para as regiões das mãos. Experimentos demonstram que nosso método alcança uma otimização de preferência eficaz para melhorar a qualidade da geração de mãos, ao mesmo tempo que reduz significativamente a barreira para a construção de dados de preferência. Os códigos estão disponíveis em https://github.com/mdswyz/IPA.
English
Human image animation has witnessed significant advancements, yet generating high-fidelity hand motions remains a persistent challenge due to their high degrees of freedom and motion complexity. While reinforcement learning from human feedback, particularly direct preference optimization, offers a potential solution, it necessitates the construction of strict preference pairs. However, curating such pairs for dynamic hand regions is prohibitively expensive and often impractical due to frame-wise inconsistencies. In this paper, we propose Implicit Preference Alignment (IPA), a data-efficient post-training framework that eliminates the need for paired preference data. Theoretically grounded in implicit reward maximization, IPA aligns the model by maximizing the likelihood of self-generated high-quality samples while penalizing deviations from the pretrained prior. Furthermore, we introduce a Hand-Aware Local Optimization mechanism to explicitly steer the alignment process toward hand regions. Experiments demonstrate that our method achieves effective preference optimization to enhance hand generation quality, while significantly lowering the barrier for constructing preference data. Codes are released at https://github.com/mdswyz/IPA