ZipSplat : Moins de gaussiennes, meilleurs splats
ZipSplat: Fewer Gaussians, Better Splats
June 3, 2026
Auteurs: Alexander Veicht, Sunghwan Hong, Dániel Baráth, Marc Pollefeys
cs.AI
Résumé
Les méthodes de splatting gaussien 3D feed-forward reconstruisent une scène à partir d’images posées ou non posées en un seul passage direct, mais les approches actuelles prédisent un gaussien par pixel d’entrée, liant ainsi le budget de représentation à la résolution de la caméra plutôt qu’à la complexité de la scène. Un mur plat et un objet richement texturé produisent donc autant de gaussiens, malgré des besoins géométriques très différents. Nous proposons ZipSplat, un modèle feed-forward basé sur des tokens qui dissocie le placement des gaussiens de la grille de pixels. Un backbone multi-vue extrait des tokens visuels denses, et un clustering k-means les compresse en un ensemble compact de tokens de scène. Des mécanismes d’attention croisée et d’auto-attention affinent ces tokens, et un MLP léger décode chacun d’eux en un groupe de gaussiens aux positions 3D non contraintes. Le clustering étant appliqué lors de l’inférence, un seul modèle entraîné couvre la courbe qualité-efficacité sans nécessiter de réentraînement. ZipSplat fonctionne sans poses réelles ni paramètres intrinsèques, tout en établissant un nouvel état de l’art sur DL3DV et RealEstate10K avec environ 6 fois moins de gaussiens que les méthodes alignées sur les pixels, surpassant la meilleure baseline sans pose de 2,1 dB et 1,2 dB de PSNR respectivement. Il se généralise en outre en zero-shot à Mip-NeRF360 et ScanNet++, surpassant toutes les baselines comparables. Notre page projet se trouve à l’adresse {https://veichta.com/zipsplat}.
English
Feed-forward 3D Gaussian Splatting methods reconstruct a scene from posed or pose-free images in a single forward pass, yet current approaches predict one Gaussian per input pixel, tying the representation budget to camera resolution rather than scene complexity. A flat wall and a richly textured object thus produce equally many Gaussians despite very different geometric needs. We propose ZipSplat, a token-based feed-forward model that decouples Gaussian placement from the pixel grid. A multi-view backbone extracts dense visual tokens, and k-means clustering compresses them into a compact set of scene tokens. Cross- and self-attention refine these tokens, and a lightweight MLP decodes each into a group of Gaussians with unconstrained 3D positions. Because clustering is applied at inference, a single trained model spans the quality-efficiency curve without retraining. ZipSplat operates without ground-truth poses or intrinsics, yet sets a new state of the art on DL3DV and RealEstate10K with {sim}6{times} fewer Gaussians than pixel-aligned methods, surpassing the best pose-free baseline by 2.1dB and 1.2dB PSNR, respectively. It further generalizes zero-shot to Mip-NeRF360 and ScanNet++, outperforming all comparable baselines. Our project page is at {https://veichta.com/zipsplat{https://veichta.com/zipsplat}}.