Verbeteren van in-context panoramische generatie via geometrie-bewuste pre-training
Enhancing In-context Panoramic Generation via Geometric-aware Pretraining
July 9, 2026
Auteurs: Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi
cs.AI
Samenvatting
In dit werk presenteren we Canvas360, een tweefasenraamwerk voor in-context panoramageneratie dat geometriebewuste pretraining combineert met downstream taakspecifieke fijnafstemming. Om het gebrek aan grootschalige, hoogwaardige trainingsdata die specifiek zijn afgestemd op in-context panoramataken aan te pakken, stellen we Canvas360Dataset voor, een verzameling van 1 miljoen hoogwaardige gepaarde panoramische monsters voor stijloverdracht, inpainting, outpainting en bewerking, waardoor effectieve supervisie mogelijk wordt in diverse in-context generatiescenario's. Aan de modelleerkant verbetert Canvas360 de tekst-naar-panorama-generatie door parallelle dieptegeneratie, velocity circular padding en regularisatie van gelijkheidsverlies, waardoor het model geometriebewuste representaties kan leren, details van objectvervorming kan vastleggen en de geometrische consistentie en globale samenhang kan verbeteren. Bovendien maakt Canvas360, versterkt door sterke panoramische prioriteiten, een verenigd in-context panoramageneratiekader mogelijk dat diverse downstream taken ondersteunt via concatenatie op token-niveau, en eerdere methoden overtreft in zowel taakdekking als modelleringsflexibiliteit. Uitgebreide experimenten tonen aan dat Canvas360 de betrouwbaarheid van panoramabeelden verbetert, met name sterke prestaties levert op de panoramaspecifieke FAED-metriek en concurrerende of leidende resultaten behaalt in de gerapporteerde kwantitatieve evaluaties. Meer informatie is te vinden op onze projectpagina: https://zry000.github.io/Canvas360/
English
In this work, we present Canvas360, a two-stage framework for in-context panoramic generation that combines geometry-aware pretraining with downstream task-specific fine-tuning. To address the lack of large-scale, high-quality training data tailored to in-context panoramic tasks, we propose Canvas360Dataset, a collection of 1M high-quality paired panoramic samples for style transfer, inpainting, outpainting, and editing, enabling effective supervision across diverse in-context generation scenarios. On the modeling side, Canvas360 enhances text-to-panorama generation through parallel depth generation, velocity circular padding, and similarity loss regularization, enabling the model to learn geometry-aware representations, capture object distortion details, and improve geometric consistency and global coherence. Furthermore, empowered by strong panoramic priors, Canvas360 enables a unified in-context panoramic generation framework that supports diverse downstream tasks via token-level concatenation, surpassing prior methods in both task coverage and modeling flexibility. Extensive experiments show that Canvas360 improves panoramic image fidelity, achieving particularly strong performance on the panorama-specific FAED metric and competitive or leading results across the reported quantitative evaluations. More information can be found on our project page: https://zry000.github.io/Canvas360/