ChatPaper.aiChatPaper

Codec Diffusion Hiérarchique pour la Génération de Parole à partir de Vidéo

Hierarchical Codec Diffusion for Video-to-Speech Generation

April 17, 2026
Auteurs: Jiaxin Ye, Gaoxiang Cong, Chenhui Wang, Xin-Cheng Wen, Zhaoyang Li, Boyuan Cao, Hongming Shan
cs.AI

Résumé

La génération vidéo-vers-parole (VTS) vise à synthétiser la parole à partir d'une vidéo silencieuse dépourvue de signaux auditifs. Cependant, les méthodes VTS existantes négligent la nature hiérarchique de la parole, qui s'étend de la sémantique grossière liée au locuteur aux détails prosodiques fins. Cette omission entrave l'alignement direct entre les caractéristiques visuelles et vocales à des niveaux hiérarchiques spécifiques lors de l'appariement des propriétés. Dans cet article, en tirant parti de la structure hiérarchique des codecs basés sur la quantification vectorielle résiduelle (RVQ), nous proposons HiCoDiT, un nouveau Transformer à Diffusion de Codec Hiérarchique qui exploite la hiérarchie inhérente des tokens vocaux discrets pour obtenir un fort alignement audiovisuel. Plus précisément, puisque les tokens de niveau inférieur encodent une sémantique grossière liée au locuteur et que les tokens de niveau supérieur capturent une prosodie fine, HiCoDiT utilise des blocs de bas niveau et de haut niveau pour générer des tokens à différents niveaux. Les blocs de bas niveau se conditionnent sur le mouvement labial synchronisé et l'identité faciale pour capturer le contenu lié au locuteur, tandis que les blocs de haut niveau utilisent l'expression faciale pour moduler la dynamique prosodique. Enfin, pour permettre un conditionnement plus efficace du grossier au fin, nous proposons une normalisation d'instance adaptative à double échelle qui capture conjointement le style vocal global via une normalisation par canal et la dynamique prosodique locale via une normalisation temporelle. Des expériences approfondies démontrent que HiCoDiT surpasse les méthodes de référence en fidélité et en expressivité, soulignant le potentiel de la modélisation discrète pour le VTS. Le code et une démonstration audio sont disponibles à l'adresse https://github.com/Jiaxin-Ye/HiCoDiT.
English
Video-to-Speech (VTS) generation aims to synthesize speech from a silent video without auditory signals. However, existing VTS methods disregard the hierarchical nature of speech, which spans coarse speaker-aware semantics to fine-grained prosodic details. This oversight hinders direct alignment between visual and speech features at specific hierarchical levels during property matching. In this paper, leveraging the hierarchical structure of Residual Vector Quantization (RVQ)-based codec, we propose HiCoDiT, a novel Hierarchical Codec Diffusion Transformer that exploits the inherent hierarchy of discrete speech tokens to achieve strong audio-visual alignment. Specifically, since lower-level tokens encode coarse speaker-aware semantics and higher-level tokens capture fine-grained prosody, HiCoDiT employs low-level and high-level blocks to generate tokens at different levels. The low-level blocks condition on lip-synchronized motion and facial identity to capture speaker-aware content, while the high-level blocks use facial expression to modulate prosodic dynamics. Finally, to enable more effective coarse-to-fine conditioning, we propose a dual-scale adaptive instance layer normalization that jointly captures global vocal style through channel-wise normalization and local prosody dynamics through temporal-wise normalization. Extensive experiments demonstrate that HiCoDiT outperforms baselines in fidelity and expressiveness, highlighting the potential of discrete modelling for VTS. The code and speech demo are both available at https://github.com/Jiaxin-Ye/HiCoDiT.