AsySplat: Эффективное асимметричное 3D-гауссово разбрызгивание для моделирования длинных последовательностей сцен
AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling
July 13, 2026
Авторы: Yingji Zhong, Dave Zhenyu Chen, Fuzhao Ou, Youyu Chen, Zhihao Li, Lanqing Hong, Dan Xu
cs.AI
Аннотация
Недавние обобщаемые модели 3D-гауссова всплеска продвинули синтез новых видов (NVS) для длинных последовательностей, однако ценой значительных избыточных вычислений. Мы выявили, что избыточность можно уменьшить, исходя из двух наблюдений: (i) геометрия высокой точности не является строго обязательной для качественного NVS; (ii) обучение внешнему виду в целом проще, чем восстановление геометрии. Руководствуясь этими соображениями, мы предлагаем асимметричную архитектуру, разделяющую моделирование геометрии и внешнего вида. Ветвь геометрии обрабатывает токены грубой зернистости, используя большую часть параметров для многовидовой реконструкции, в то время как ветвь внешнего вида работает с токенами мелкой зернистости, фиксируя детали при значительно меньшем числе параметров. Две ветви взаимодействуют через двусторонние связи, обеспечивая взаимное направление для своих задач. Такая осведомленная о задаче асимметрия снижает вычислительную избыточность и более рационально распределяет вычисления, тем самым повышая эффективность параметров и позволяя меньшим моделям достигать высокой производительности. На входных данных 32 вида при разрешении 960P наша модель сравнима с методами, основанными на оптимизации, обеспечивая при этом ускорение почти в 800 раз, и превосходит производительность в режиме zero-shot современных обобщаемых моделей при заметно меньшем числе параметров и сниженных вычислительных затратах на обучение и инференс, что в целом повышает эффективность.
English
Recent generalizable 3D Gaussian Splatting models have advanced long-sequence novel view synthesis (NVS), but at the cost of substantial redundant computation. We identify that the redundancy can be mitigated based on two observations: (i) high-precision geometry is not strictly required for high-quality NVS; (ii) appearance learning is generally easier than geometry recovery. Motivated by these insights, we propose an asymmetric architecture that decouples geometry and appearance modeling. The geometry branch processes coarse-grained tokens with most of the parameters for multi-view reconstruction, while the appearance branch operates on fine-grained tokens to capture details using significantly fewer parameters. The two branches interact through bilateral connections, enabling mutual guidance for their respective tasks. This task-aware asymmetry reduces the computational redundancy and allocates the computation more judiciously, thereby increasing parameter efficiency and enabling smaller models to achieve strong performance. On 32-view 960P inputs, our model matches optimization-based methods while delivering nearly 800x speedup, and surpasses the zero-shot performance of state-of-the-art generalizable models with markedly fewer parameters and reduced training/inference overhead, achieving an overall efficiency improvement.