AsySplat: Splatting Asimétrico Eficiente de Gaussianos 3D para Modelado de Escenas de Secuencias Largas
AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling
July 13, 2026
Autores: Yingji Zhong, Dave Zhenyu Chen, Fuzhao Ou, Youyu Chen, Zhihao Li, Lanqing Hong, Dan Xu
cs.AI
Resumen
Recientes modelos generalizables de Gaussian Splatting 3D han avanzado en la síntesis de vista novedosa (NVS) de secuencias largas, pero al costo de un cómputo sustancialmente redundante. Identificamos que esta redundancia puede mitigarse basándose en dos observaciones: (i) la geometría de alta precisión no es estrictamente necesaria para una NVS de alta calidad; (ii) el aprendizaje de apariencia es generalmente más fácil que la recuperación de geometría. Motivados por estas ideas, proponemos una arquitectura asimétrica que desacopla el modelado de geometría y apariencia. La rama de geometría procesa tokens de grano grueso con la mayoría de los parámetros para la reconstrucción multivista, mientras que la rama de apariencia opera sobre tokens de grano fino para capturar detalles utilizando significativamente menos parámetros. Ambas ramas interactúan a través de conexiones bilaterales, permitiendo una guía mutua en sus respectivas tareas. Esta asimetría consciente de la tarea reduce la redundancia computacional y distribuye el cómputo de manera más juiciosa, incrementando así la eficiencia de los parámetros y permitiendo que modelos más pequeños alcancen un rendimiento sólido. En entradas de 960P con 32 vistas, nuestro modelo iguala a los métodos basados en optimización, a la vez que ofrece una aceleración de casi 800 veces, y supera el rendimiento zero-shot de los modelos generalizables de última generación con notablemente menos parámetros y un menor costo de entrenamiento/inferencia, logrando una mejora global de eficiencia.
English
Recent generalizable 3D Gaussian Splatting models have advanced long-sequence novel view synthesis (NVS), but at the cost of substantial redundant computation. We identify that the redundancy can be mitigated based on two observations: (i) high-precision geometry is not strictly required for high-quality NVS; (ii) appearance learning is generally easier than geometry recovery. Motivated by these insights, we propose an asymmetric architecture that decouples geometry and appearance modeling. The geometry branch processes coarse-grained tokens with most of the parameters for multi-view reconstruction, while the appearance branch operates on fine-grained tokens to capture details using significantly fewer parameters. The two branches interact through bilateral connections, enabling mutual guidance for their respective tasks. This task-aware asymmetry reduces the computational redundancy and allocates the computation more judiciously, thereby increasing parameter efficiency and enabling smaller models to achieve strong performance. On 32-view 960P inputs, our model matches optimization-based methods while delivering nearly 800x speedup, and surpasses the zero-shot performance of state-of-the-art generalizable models with markedly fewer parameters and reduced training/inference overhead, achieving an overall efficiency improvement.