ChatPaper.aiChatPaper

Mejorando la Generación Panorámica en Contexto mediante Pretrenamiento con Conciencia Geométrica

Enhancing In-context Panoramic Generation via Geometric-aware Pretraining

July 9, 2026
Autores: Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi
cs.AI

Resumen

En este trabajo, presentamos Canvas360, un marco de dos etapas para la generación panorámica en contexto que combina un preentrenamiento sensible a la geometría con un ajuste fino específico para tareas posteriores. Para abordar la falta de datos de entrenamiento a gran escala y de alta calidad adaptados a tareas panorámicas en contexto, proponemos Canvas360Dataset, una colección de 1 millón de muestras panorámicas pareadas de alta calidad para transferencia de estilo, inpintado, outpintado y edición, lo que permite una supervisión efectiva en diversos escenarios de generación en contexto. En el aspecto de modelado, Canvas360 mejora la generación de texto a panorama a través de la generación paralela de profundidad, el relleno circular de velocidad y la regularización de pérdida de similitud, permitiendo que el modelo aprenda representaciones sensibles a la geometría, capture detalles de distorsión de objetos y mejore la consistencia geométrica y la coherencia global. Además, potenciado por fuertes prioris panorámicos, Canvas360 permite un marco unificado de generación panorámica en contexto que respalda diversas tareas posteriores mediante la concatenación a nivel de tokens, superando a métodos anteriores tanto en cobertura de tareas como en flexibilidad de modelado. Experimentos exhaustivos muestran que Canvas360 mejora la fidelidad de las imágenes panorámicas, logrando un rendimiento particularmente sólido en la métrica FAED específica de panoramas y resultados competitivos o líderes en las evaluaciones cuantitativas reportadas. Se puede encontrar más información en nuestra página del proyecto: https://zry000.github.io/Canvas360/
English
In this work, we present Canvas360, a two-stage framework for in-context panoramic generation that combines geometry-aware pretraining with downstream task-specific fine-tuning. To address the lack of large-scale, high-quality training data tailored to in-context panoramic tasks, we propose Canvas360Dataset, a collection of 1M high-quality paired panoramic samples for style transfer, inpainting, outpainting, and editing, enabling effective supervision across diverse in-context generation scenarios. On the modeling side, Canvas360 enhances text-to-panorama generation through parallel depth generation, velocity circular padding, and similarity loss regularization, enabling the model to learn geometry-aware representations, capture object distortion details, and improve geometric consistency and global coherence. Furthermore, empowered by strong panoramic priors, Canvas360 enables a unified in-context panoramic generation framework that supports diverse downstream tasks via token-level concatenation, surpassing prior methods in both task coverage and modeling flexibility. Extensive experiments show that Canvas360 improves panoramic image fidelity, achieving particularly strong performance on the panorama-specific FAED metric and competitive or leading results across the reported quantitative evaluations. More information can be found on our project page: https://zry000.github.io/Canvas360/