ChatPaper.aiChatPaper

AsySplat : Splatting gaussien 3D asymétrique efficace pour la modélisation de scènes à longue séquence

AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling

July 13, 2026
Auteurs: Yingji Zhong, Dave Zhenyu Chen, Fuzhao Ou, Youyu Chen, Zhihao Li, Lanqing Hong, Dan Xu
cs.AI

Résumé

Les récents modèles généralisables de Gaussian Splatting 3D ont fait progresser la synthèse de nouvelle vue (NVS) sur de longues séquences, mais au prix d’un calcul redondant substantiel. Nous identifions que cette redondance peut être atténuée en s’appuyant sur deux observations : (i) une géométrie de haute précision n’est pas strictement nécessaire pour une NVS de haute qualité ; (ii) l’apprentissage de l’apparence est généralement plus facile que la récupération de la géométrie. Motivés par ces observations, nous proposons une architecture asymétrique qui dissocie la modélisation de la géométrie et de l’apparence. La branche géométrie traite des jetons à gros grains avec la plupart des paramètres pour la reconstruction multi-vue, tandis que la branche apparence opère sur des jetons à grains fins pour capturer les détails en utilisant beaucoup moins de paramètres. Les deux branches interagissent par le biais de connexions bilatérales, permettant un guidage mutuel pour leurs tâches respectives. Cette asymétrie consciente des tâches réduit la redondance de calcul et répartit le calcul de manière plus judicieuse, augmentant ainsi l’efficacité des paramètres et permettant à des modèles plus petits d’atteindre de bonnes performances. Sur des entrées 32 vues en 960P, notre modèle égalise les méthodes basées sur l’optimisation tout en offrant une accélération de près de 800x, et dépasse les performances zero-shot des modèles généralisables de pointe avec nettement moins de paramètres et une charge réduite d’entraînement/d’inférence, réalisant ainsi une amélioration globale de l’efficacité.
English
Recent generalizable 3D Gaussian Splatting models have advanced long-sequence novel view synthesis (NVS), but at the cost of substantial redundant computation. We identify that the redundancy can be mitigated based on two observations: (i) high-precision geometry is not strictly required for high-quality NVS; (ii) appearance learning is generally easier than geometry recovery. Motivated by these insights, we propose an asymmetric architecture that decouples geometry and appearance modeling. The geometry branch processes coarse-grained tokens with most of the parameters for multi-view reconstruction, while the appearance branch operates on fine-grained tokens to capture details using significantly fewer parameters. The two branches interact through bilateral connections, enabling mutual guidance for their respective tasks. This task-aware asymmetry reduces the computational redundancy and allocates the computation more judiciously, thereby increasing parameter efficiency and enabling smaller models to achieve strong performance. On 32-view 960P inputs, our model matches optimization-based methods while delivering nearly 800x speedup, and surpasses the zero-shot performance of state-of-the-art generalizable models with markedly fewer parameters and reduced training/inference overhead, achieving an overall efficiency improvement.