ChatPaper.aiChatPaper

Amélioration de la génération panoramique en contexte via un pré-entraînement géométrique

Enhancing In-context Panoramic Generation via Geometric-aware Pretraining

July 9, 2026
Auteurs: Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi
cs.AI

Résumé

Dans ce travail, nous présentons Canvas360, un cadre en deux étapes pour la génération panoramique en contexte, combinant un pré-entraînement tenant compte de la géométrie avec un ajustement fin spécifique à la tâche en aval. Pour pallier l'absence de données d'entraînement à grande échelle et de haute qualité adaptées aux tâches panoramiques en contexte, nous proposons Canvas360Dataset, une collection d'un million d'échantillons panoramiques appariés de haute qualité pour le transfert de style, l'inpainting, l'outpainting et l'édition, permettant une supervision efficace dans divers scénarios de génération en contexte. Côté modélisation, Canvas360 améliore la génération texte-vers-panorama grâce à la génération parallèle de profondeur, au rembourrage circulaire de vélocité et à la régularisation de perte de similarité, permettant au modèle d'apprendre des représentations conscientes de la géométrie, de capturer les détails de distorsion des objets, et d'améliorer la cohérence géométrique et la cohérence globale. De plus, grâce à de forts a priori panoramiques, Canvas360 permet un cadre unifié de génération panoramique en contexte qui supporte diverses tâches en aval via une concaténation au niveau des tokens, surpassant les méthodes antérieures tant en couverture de tâches qu'en flexibilité de modélisation. Des expériences approfondies montrent que Canvas360 améliore la fidélité des images panoramiques, obtenant des performances particulièrement solides sur la métrique FAED spécifique aux panoramas et des résultats compétitifs ou de premier plan dans l'ensemble des évaluations quantitatives rapportées. Plus d'informations sont disponibles sur notre page de projet : https://zry000.github.io/Canvas360/
English
In this work, we present Canvas360, a two-stage framework for in-context panoramic generation that combines geometry-aware pretraining with downstream task-specific fine-tuning. To address the lack of large-scale, high-quality training data tailored to in-context panoramic tasks, we propose Canvas360Dataset, a collection of 1M high-quality paired panoramic samples for style transfer, inpainting, outpainting, and editing, enabling effective supervision across diverse in-context generation scenarios. On the modeling side, Canvas360 enhances text-to-panorama generation through parallel depth generation, velocity circular padding, and similarity loss regularization, enabling the model to learn geometry-aware representations, capture object distortion details, and improve geometric consistency and global coherence. Furthermore, empowered by strong panoramic priors, Canvas360 enables a unified in-context panoramic generation framework that supports diverse downstream tasks via token-level concatenation, surpassing prior methods in both task coverage and modeling flexibility. Extensive experiments show that Canvas360 improves panoramic image fidelity, achieving particularly strong performance on the panorama-specific FAED metric and competitive or leading results across the reported quantitative evaluations. More information can be found on our project page: https://zry000.github.io/Canvas360/