Улучшение контекстной панорамной генерации с помощью геометрически-осведомленного предобучения
Enhancing In-context Panoramic Generation via Geometric-aware Pretraining
July 9, 2026
Авторы: Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi
cs.AI
Аннотация
В данной работе мы представляем Canvas360 — двухэтапную структуру для генерации панорам в контексте, объединяющую предварительное обучение с учетом геометрии и последующую тонкую настройку под конкретные задачи. Для решения проблемы отсутствия крупномасштабных высококачественных обучающих данных, адаптированных для задач генерации панорам в контексте, мы предлагаем Canvas360Dataset — коллекцию из 1 миллиона высококачественных парных панорамных образцов для переноса стиля, инпейнтинга, аутпейнтинга и редактирования, обеспечивающую эффективное обучение в различных сценариях контекстной генерации. Со стороны моделирования Canvas360 улучшает генерацию текста в панораму за счет параллельной генерации глубины, циклического дополнения на основе скорости и регуляризации с использованием функции потерь подобия, что позволяет модели изучать представления с учетом геометрии, фиксировать детали искажения объектов, а также повышать геометрическую согласованность и глобальную когерентность. Кроме того, опираясь на сильные панорамные априорные знания, Canvas360 реализует унифицированную структуру генерации панорам в контексте, поддерживающую различные последующие задачи посредством конкатенации на уровне токенов, превосходя предыдущие методы как по охвату задач, так и по гибкости моделирования. Обширные эксперименты показывают, что Canvas360 повышает достоверность панорамных изображений, демонстрируя особенно высокую производительность по специфичной для панорам метрике FAED, а также конкурентоспособные или ведущие результаты в рамках представленных количественных оценок. Дополнительную информацию можно найти на странице нашего проекта: https://zry000.github.io/Canvas360/
English
In this work, we present Canvas360, a two-stage framework for in-context panoramic generation that combines geometry-aware pretraining with downstream task-specific fine-tuning. To address the lack of large-scale, high-quality training data tailored to in-context panoramic tasks, we propose Canvas360Dataset, a collection of 1M high-quality paired panoramic samples for style transfer, inpainting, outpainting, and editing, enabling effective supervision across diverse in-context generation scenarios. On the modeling side, Canvas360 enhances text-to-panorama generation through parallel depth generation, velocity circular padding, and similarity loss regularization, enabling the model to learn geometry-aware representations, capture object distortion details, and improve geometric consistency and global coherence. Furthermore, empowered by strong panoramic priors, Canvas360 enables a unified in-context panoramic generation framework that supports diverse downstream tasks via token-level concatenation, surpassing prior methods in both task coverage and modeling flexibility. Extensive experiments show that Canvas360 improves panoramic image fidelity, achieving particularly strong performance on the panorama-specific FAED metric and competitive or leading results across the reported quantitative evaluations. More information can be found on our project page: https://zry000.github.io/Canvas360/