AsySplat: Efficiënt asymmetrisch 3D Gaussian Splatting voor modellering van lange scènereeksen
AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling
July 13, 2026
Auteurs: Yingji Zhong, Dave Zhenyu Chen, Fuzhao Ou, Youyu Chen, Zhihao Li, Lanqing Hong, Dan Xu
cs.AI
Samenvatting
Recente generaliseerbare 3D Gaussiaanse Splatting-modellen hebben de synthese van lange sequenties van nieuwe aanzichten (NVS) bevorderd, maar ten koste van aanzienlijke overbodige berekeningen. We stellen vast dat deze redundantie kan worden verminderd op basis van twee observaties: (i) hoge-precisie geometrie is niet strikt noodzakelijk voor hoogwaardige NVS; (ii) het leren van uiterlijk is over het algemeen eenvoudiger dan het herstellen van geometrie. Gemotiveerd door deze inzichten stellen we een asymmetrische architectuur voor die de modellering van geometrie en uiterlijk ontkoppelt. De geometrietak verwerkt grofkorrelige tokens met de meeste parameters voor multi-view reconstructie, terwijl de uiterlijktak werkt met fijnkorrelige tokens om details vast te leggen met aanzienlijk minder parameters. De twee takken werken samen via bilaterale verbindingen, waardoor wederzijdse begeleiding voor hun respectievelijke taken mogelijk wordt. Deze taakbewuste asymmetrie vermindert de rekenkundige redundantie en verdeelt de berekeningen oordeelkundiger, waardoor de parameterefficiëntie toeneemt en kleinere modellen sterke prestaties kunnen leveren. Bij invoer van 32 aanzichten met 960P presteert ons model vergelijkbaar met optimalisatiegebaseerde methoden, terwijl het een bijna 800x versnelling biedt, en overtreft het de zero-shot prestaties van state-of-the-art generaliseerbare modellen met aanzienlijk minder parameters en verminderde trainings-/inferentie-overhead, wat leidt tot een algehele efficiëntieverbetering.
English
Recent generalizable 3D Gaussian Splatting models have advanced long-sequence novel view synthesis (NVS), but at the cost of substantial redundant computation. We identify that the redundancy can be mitigated based on two observations: (i) high-precision geometry is not strictly required for high-quality NVS; (ii) appearance learning is generally easier than geometry recovery. Motivated by these insights, we propose an asymmetric architecture that decouples geometry and appearance modeling. The geometry branch processes coarse-grained tokens with most of the parameters for multi-view reconstruction, while the appearance branch operates on fine-grained tokens to capture details using significantly fewer parameters. The two branches interact through bilateral connections, enabling mutual guidance for their respective tasks. This task-aware asymmetry reduces the computational redundancy and allocates the computation more judiciously, thereby increasing parameter efficiency and enabling smaller models to achieve strong performance. On 32-view 960P inputs, our model matches optimization-based methods while delivering nearly 800x speedup, and surpasses the zero-shot performance of state-of-the-art generalizable models with markedly fewer parameters and reduced training/inference overhead, achieving an overall efficiency improvement.