SpheRoPE: Zero-shot optimalisatievrije 360-panoramageneratie met sferische RoPE
SpheRoPE: Zero-Shot Optimization-Free 360 Panorama Generation with Spherical RoPE
June 30, 2026
Auteurs: Or Hirschorn, Aaron Olender, Eli Alshan, Ianir Ideses, Lior Fritz, Sagie Benaim
cs.AI
Samenvatting
We presenteren een nul-shot, trainingsvrij en optimalisatievrij raamwerk voor het genereren van 360° panoramische afbeeldingen en video's door rechtstreeks sferische priori's te injecteren in voorgetrainde diffusietransformers. Bestaande methoden zijn ofwel afhankelijk van kostbare fine-tuning op schaarse panoramische gegevens, wat de generalisatie beperkt, ofwel gebruiken ze meerstapsoptimalisatie die leidt tot onaanvaardbare inferentievertraging. We observeren dat hedendaagse generatieve modellen van nature enkele panoramische priori's vertonen door training op grote schaal. Deze emergente capaciteiten zijn echter ontoereikend, omdat de modellen fundamenteel niet voldoen aan de rigoureuze topologische beperkingen die worden opgelegd door equirectangulaire projectie (ERP). We introduceren een nul-shot en optimalisatievrije benadering die deze beperkingen oplost tijdens inferentie. Spherical RoPE vervangt standaard rotatiepositiesinbeddingen: laagfrequente kanalen worden geherparametriseerd als 3D-Cartesiaanse coördinaten om de sferische variëteit van nature te coderen, terwijl hoogfrequente kanalen harmonisch worden gekwantiseerd om exacte periodiciteit af te dwingen. In combinatie met complementaire Semantic Distortion classifier-vrije begeleiding (CFG) die expliciet de geometrie stuurt, vermijden we hertraining en erven we de volledige creatieve breedte van de modernste modellen. Onze benadering generaliseert over diverse backbones en 360°-generatiemodaliteiten. We demonstreren dit voor tekst-naar-panorama met Flux.1-, Flux.2- en LTX-Video-backbones, en behalen concurrerende prestaties ten opzichte van baselines, terwijl we trainingsvrij blijven. Projectpagina: https://orhir.github.io/SpheRoPE
English
We present a zero-shot, training-free and optimization-free framework for generating 360 panoramic images and videos by directly injecting spherical priors into pre-trained diffusion transformers. Existing methods either rely on costly fine-tuning on scarce panoramic data that limits generalization, or leverage multi-step optimization that incurs prohibitive inference latency. We observe that contemporary generative models natively exhibit some panoramic priors from large-scale training. However, these emergent capabilities are insufficient, as the models fundamentally fail to satisfy the rigorous topological constraints imposed by equirectangular projection (ERP). We introduce a zero-shot and optimization-free approach that resolves these constraints at inference time. Spherical RoPE replaces standard rotary position embeddings: low-frequency channels are re-parameterized as 3D Cartesian coordinates to natively encode the spherical manifold, while high-frequency channels are harmonically quantized to enforce exact periodicity. Coupled with complementary Semantic Distortion classifier-free guidance (CFG) that explicitly steers geometry, we avoid retraining and inherit the full creative breadth of state-of-the-art models. Our approach generalizes across diverse backbones and 360 generation modalities. We demonstrate this across text-to-panorama using Flux.1, Flux.2, and LTX-Video backbones, achieving competitive performance against baselines, all while remaining training-free. Project page: https://orhir.github.io/SpheRoPE