SpatialAvatar-0: Avatar de Cabeça 4D de Alta Qualidade com Reconstrução em Múltiplas Etapas
SpatialAvatar-0: High-Quality 4D Head Avatar with Multi-Stage Reconstruction
June 14, 2026
Autores: Yiran Wang, Zeyu Zhang, Yuanming Li, Ziming Wang, Yang Zhao
cs.AI
Resumo
Avatares de cabeça 4D de alta qualidade a partir de um ou poucos retratos de origem são centrais para telepresença, AR/VR e interação humano-digital. O 3D Gaussian Splatting (3DGS) emergiu como a representação dominante, com dois regimes complementares (preditores feed-forward generalizáveis e refinadores por sujeito) amadurecendo em paralelo. No entanto, os preditores feed-forward existentes são treinados em uma única família de conjuntos de dados com um número fixo de fontes codificado, herdando o viés de domínio correspondente. Os refinadores por sujeito requerem 300.000 a 600.000 iterações e dependem de densificação adaptativa que destrói o layout gaussiano upstream, impedindo que os dois regimes compartilhem uma representação ponta a ponta. Para unir ambos os regimes, propomos o SpatialAvatar-0 sobre uma representação gaussiana compartilhada ligada à malha FLAME: um gerador feed-forward com um mean-pool de K fontes livre de parâmetros e um cronograma de duas fases, de monocular-temporal para multi-visual-espacial, que ancora contra o colapso do prior de identidade no conjunto multi-visual menor. Introduzimos também um laço de refinamento por sujeito de 10.000 iterações que preserva o layout, que congela a ligação ao FLAME e a contagem de gaussianas, substituindo a densificação por uma regularização anti-pico de três componentes. No domínio cruzado zero-shot VFHQ/HDTF, superamos o líder no domínio interno GAGAvatar em +1,5 dB PSNR, apesar de nunca termos treinado em nenhum dos domínios de teste; e no benchmark monocular SplattingAvatar, lideramos todas as métricas relatadas, superando o GeoAvatar de 300.000 iterações em +1,3 dB PSNR, com um cronograma por sujeito até 60x mais curto do que as linhas de base SOTA comuns. Site: https://spatialwalk.github.io/SpatialAvatar-0.
English
High-quality 4D head avatars from one or a few source portraits are central to telepresence, AR/VR, and digital-human interaction. 3D Gaussian Splatting (3DGS) has emerged as the dominant representation, with two complementary regimes (generalizable feed-forward predictors and per-subject refiners) maturing in parallel. However, existing feed-forward predictors are trained on a single dataset family with a hard-coded source count, inheriting the corresponding domain bias. Per-subject refiners require 300K--600K iterations and rely on adaptive densification that destroys upstream Gaussian layouts, preventing the two regimes from sharing a representation end-to-end. To bridge both regimes we propose SpatialAvatar-0 on a shared FLAME-mesh-bound Gaussian representation: a feed-forward generator with a parameter-free K-source mean-pool and a monocular-temporal to multi-view-spatial two-phase schedule that anchors against identity-prior collapse onto the smaller multi-view set. We further introduce a 10K-iter layout-preserving per-subject refinement loop that freezes the FLAME-binding and Gaussian count and replaces densification with a three-component anti-spike regularization. On VFHQ/HDTF cross-domain zero-shot we surpass the in-domain leader GAGAvatar by +1.5 dB PSNR despite never training on either test domain, and on the SplattingAvatar monocular benchmark we lead every reported metric, surpassing the 300K-iter GeoAvatar by +1.3 dB PSNR at up to 60x shorter per-subject schedule than common SOTA baselines. Website: https://spatialwalk.github.io/SpatialAvatar-0.