RaysUp: Upsampling Universal Ultraleve de Características via Representação de Raios Consciente da Geometria
RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation
June 22, 2026
Autores: Yuchuan Ding, Linfei Li, Lin Zhang, Ying Shen
cs.AI
Resumo
Os Modelos de Visão de Fundação (VFMs) pré-treinados tornaram-se centrais na visão computacional moderna devido às suas poderosas representações semânticas e forte capacidade de generalização. No entanto, suas saídas transformadas em patches ou com pooling são inerentemente de baixa resolução, limitando sua eficácia em tarefas que exigem raciocínio em nível de pixel de granulação fina. Abordagens existentes de upsampling de características degradam a fidelidade semântica ou dependem de retreinamentos específicos de VFMs e arquiteturas pesadas, prejudicando a eficiência e escalabilidade. Para enfrentar esses desafios, propomos o RaysUp, uma estrutura de upsampling de características ultraleve, agnóstica à tarefa e agnóstica ao VFM, que reconstrói mapas de características de alta resolução em resoluções arbitrárias. Ao contrário de esquemas convencionais de interpolação 2D ou baseados em atenção, o RaysUp eleva a reconstrução de características para um domínio de raios com consciência geométrica. Especificamente, introduzimos um Codificador de Orientação Espacialmente Desacoplado para codificação de orientação ciente da direção, um mecanismo de Atenção Cruzada de Qualquer Resolução para reconstrução flexível à resolução e uma nova Codificação Posicional de Raios (RayPE) que injeta priores geométricos 3D implícitos por meio de coordenadas de raios de Plücker 6D. Por fim, um módulo de Atenção de Vizinhança com Consciência Geométrica garante agregação bilateral adaptativa ao conteúdo, preservando a consistência geométrica. Experimentos extensivos em diversas tarefas de predição densa demonstram que o RaysUp atinge desempenho de ponta usando apenas 16% dos parâmetros do AnyUp e oferecendo inferência aproximadamente 7 vezes mais rápida. Esses resultados destacam uma compensação precisão-eficiência substancialmente melhorada e estabelecem o RaysUp como uma solução prática e escalável para upsampling universal de características. O código está disponível em https://github.com/MAP-RaysUp/RaysUp.
English
Pre-trained Vision Foundation Models (VFMs) have become central to modern computer vision due to their powerful semantic representations and strong generalization ability. However, their patchified or pooled outputs are inherently low-resolution, limiting their effectiveness in tasks requiring fine-grained, pixel-level reasoning. Existing feature upsampling approaches either degrade semantic fidelity or rely on VFM-specific retraining and heavy architectures, hindering efficiency and scalability. To address these challenges, we propose RaysUp, an ultra-lightweight, task-agnostic, and VFM-agnostic feature upsampling framework that reconstructs high-resolution feature maps at arbitrary resolutions. Unlike conventional 2D interpolation or attention-based schemes, RaysUp lifts feature reconstruction into a geometry-aware ray domain. Specifically, we introduce a Spatially Decoupled Guidance Encoder for direction-aware guidance encoding, an Any-Resolution Cross-Attention mechanism for resolution-flexible reconstruction, and a novel Ray Positional Encoding (RayPE) that injects implicit 3D geometric priors via 6D Plucker ray coordinates. Finally, a Geometry-Aware Neighborhood Attention module further ensures content-adaptive bilateral aggregation while preserving geometric consistency. Extensive experiments across diverse dense prediction tasks demonstrate that RaysUp achieves state-of-the-art performance while using only 16% of the parameters of AnyUp and delivering approximately 7x faster inference. These results highlight a substantially improved accuracy-efficiency trade-off and establish RaysUp as a practical and scalable solution for universal feature upsampling. Code is available at https://github.com/MAP-RaysUp/RaysUp.