ChatPaper.aiChatPaper

SpheRoPE: Geração de Panoramas 360 Zero-Shot e Sem Otimização com Spherical RoPE

SpheRoPE: Zero-Shot Optimization-Free 360 Panorama Generation with Spherical RoPE

June 30, 2026
Autores: Or Hirschorn, Aaron Olender, Eli Alshan, Ianir Ideses, Lior Fritz, Sagie Benaim
cs.AI

Resumo

Apresentamos uma estrutura zero-shot, livre de treinamento e livre de otimização para a geração de imagens e vídeos panorâmicos 360°, injetando diretamente priores esféricos em transformadores de difusão pré-treinados. Métodos existentes ou dependem de ajustes finos custosos em dados panorâmicos escassos, o que limita a generalização, ou utilizam otimização de múltiplas etapas, que incorre em latência de inferência proibitiva. Observamos que modelos generativos contemporâneos já exibem, de forma nativa, alguns priores panorâmicos provenientes de treinamento em larga escala. No entanto, essas capacidades emergentes são insuficientes, pois os modelos fundamentalmente falham em satisfazer as restrições topológicas rigorosas impostas pela projeção equirretangular (ERP). Introduzimos uma abordagem zero-shot e livre de otimização que resolve essas restrições no momento da inferência. O Spherical RoPE substitui os embeddings posicionais rotativos padrão: canais de baixa frequência são reparametrizados como coordenadas cartesianas 3D para codificar nativamente a variedade esférica, enquanto canais de alta frequência são quantizados harmonicamente para impor periodicidade exata. Em conjunto com a Orientação Livre de Classificador (CFG) de Distorção Semântica complementar, que direciona explicitamente a geometria, evitamos o retreinamento e herdamos toda a amplitude criativa dos modelos de última geração. Nossa abordagem generaliza-se por diversos backbones e modalidades de geração 360°. Demonstramos isso em texto para panorama utilizando os backbones Flux.1, Flux.2 e LTX-Video, alcançando desempenho competitivo em relação às referências, tudo isso sem necessidade de treinamento. Página do projeto: https://orhir.github.io/SpheRoPE
English
We present a zero-shot, training-free and optimization-free framework for generating 360 panoramic images and videos by directly injecting spherical priors into pre-trained diffusion transformers. Existing methods either rely on costly fine-tuning on scarce panoramic data that limits generalization, or leverage multi-step optimization that incurs prohibitive inference latency. We observe that contemporary generative models natively exhibit some panoramic priors from large-scale training. However, these emergent capabilities are insufficient, as the models fundamentally fail to satisfy the rigorous topological constraints imposed by equirectangular projection (ERP). We introduce a zero-shot and optimization-free approach that resolves these constraints at inference time. Spherical RoPE replaces standard rotary position embeddings: low-frequency channels are re-parameterized as 3D Cartesian coordinates to natively encode the spherical manifold, while high-frequency channels are harmonically quantized to enforce exact periodicity. Coupled with complementary Semantic Distortion classifier-free guidance (CFG) that explicitly steers geometry, we avoid retraining and inherit the full creative breadth of state-of-the-art models. Our approach generalizes across diverse backbones and 360 generation modalities. We demonstrate this across text-to-panorama using Flux.1, Flux.2, and LTX-Video backbones, achieving competitive performance against baselines, all while remaining training-free. Project page: https://orhir.github.io/SpheRoPE