MuRF: De multi-schaal potentie van vision foundation models ontsluiten
MuRF: Unlocking the Multi-Scale Potential of Vision Foundation Models
March 26, 2026
Auteurs: Bocheng Zou, Mu Cai, Mark Stanley, Dingfu Lu, Yong Jae Lee
cs.AI
Samenvatting
Vision Foundation Models (VFMs) zijn de hoeksteen geworden van moderne computer vision, en bieden robuuste representaties voor een breed scala aan taken. Hoewel recente ontwikkelingen deze modellen in staat stellen om variërende invoergroottes tijdens de training te verwerken, blijft de inferentie doorgaans beperkt tot een enkele, vaste schaal. Dit heersende enkelschalige paradigma negeert een fundamentele eigenschap van visuele waarneming: verschillende resoluties bieden complementaire inductieve biases, waarbij laagresolutie-beelden uitblinken in globale semantische herkenning en hoogresolutie-beelden essentieel zijn voor fijnmazige verfijning. In dit werk stellen we Multi-Resolution Fusion (MuRF) voor, een eenvoudige maar universeel effectieve strategie om deze synergie tijdens de inferentie te benutten. In plaats van te vertrouwen op een enkele weergave, construeert MuRF een verenigde representatie door een afbeelding op meerdere resoluties te verwerken via een bevroren VFM en de resulterende kenmerken te fuseren. De universaliteit van MuRF is zijn meest overtuigende eigenschap. Het is niet gebonden aan een specifieke architectuur, maar dient als een fundamentele, trainingsvrije verbetering van visuele representatie. We valideren dit empirisch door MuRF toe te passen op een breed spectrum van kritieke computer vision-taken over meerdere verschillende VFM-families - voornamelijk DINOv2, maar tonen ook succesvolle generalisatie aan naar contrastieve modellen zoals SigLIP2.
English
Vision Foundation Models (VFMs) have become the cornerstone of modern computer vision, offering robust representations across a wide array of tasks. While recent advances allow these models to handle varying input sizes during training, inference typically remains restricted to a single, fixed scale. This prevalent single-scale paradigm overlooks a fundamental property of visual perception: varying resolutions offer complementary inductive biases, where low-resolution views excel at global semantic recognition and high-resolution views are essential for fine-grained refinement. In this work, we propose Multi-Resolution Fusion (MuRF), a simple yet universally effective strategy to harness this synergy at inference time. Instead of relying on a single view, MuRF constructs a unified representation by processing an image at multiple resolutions through a frozen VFM and fusing the resulting features. The universality of MuRF is its most compelling attribute. It is not tied to a specific architecture, serving instead as a fundamental, training-free enhancement to visual representation. We empirically validate this by applying MuRF to a broad spectrum of critical computer vision tasks across multiple distinct VFM families - primarily DINOv2, but also demonstrating successful generalization to contrastive models like SigLIP2.