Aprimorando a Geração Panorâmica em Contexto via Pré-treinamento com Consciência Geométrica
Enhancing In-context Panoramic Generation via Geometric-aware Pretraining
July 9, 2026
Autores: Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi
cs.AI
Resumo
Neste trabalho, apresentamos o Canvas360, uma estrutura em dois estágios para geração panorâmica in-context que combina pré-treinamento ciente da geometria com ajuste fino específico para tarefas posteriores. Para lidar com a falta de dados de treinamento em larga escala e alta qualidade adaptados a tarefas panorâmicas in-context, propomos o Canvas360Dataset, uma coleção de 1 milhão de amostras panorâmicas pareadas de alta qualidade para transferência de estilo, inpainting, outpainting e edição, possibilitando supervisão eficaz em diversos cenários de geração in-context. No lado da modelagem, o Canvas360 aprimora a geração texto-para-panorama por meio de geração de profundidade paralela, preenchimento circular de velocidade e regularização de perda de similaridade, permitindo que o modelo aprenda representações conscientes da geometria, capture detalhes de distorção de objetos e melhore a consistência geométrica e a coerência global. Além disso, capacitado por fortes priors panorâmicos, o Canvas360 possibilita uma estrutura unificada de geração panorâmica in-context que suporta diversas tarefas posteriores por meio de concatenação no nível de token, superando métodos anteriores tanto em cobertura de tarefas quanto em flexibilidade de modelagem. Experimentos extensos mostram que o Canvas360 melhora a fidelidade da imagem panorâmica, alcançando desempenho particularmente forte na métrica FAED específica para panoramas e resultados competitivos ou líderes nas avaliações quantitativas reportadas. Mais informações podem ser encontradas em nossa página do projeto: https://zry000.github.io/Canvas360/
English
In this work, we present Canvas360, a two-stage framework for in-context panoramic generation that combines geometry-aware pretraining with downstream task-specific fine-tuning. To address the lack of large-scale, high-quality training data tailored to in-context panoramic tasks, we propose Canvas360Dataset, a collection of 1M high-quality paired panoramic samples for style transfer, inpainting, outpainting, and editing, enabling effective supervision across diverse in-context generation scenarios. On the modeling side, Canvas360 enhances text-to-panorama generation through parallel depth generation, velocity circular padding, and similarity loss regularization, enabling the model to learn geometry-aware representations, capture object distortion details, and improve geometric consistency and global coherence. Furthermore, empowered by strong panoramic priors, Canvas360 enables a unified in-context panoramic generation framework that supports diverse downstream tasks via token-level concatenation, surpassing prior methods in both task coverage and modeling flexibility. Extensive experiments show that Canvas360 improves panoramic image fidelity, achieving particularly strong performance on the panorama-specific FAED metric and competitive or leading results across the reported quantitative evaluations. More information can be found on our project page: https://zry000.github.io/Canvas360/