CogSENet: Desborramento Cego de Imagem com Roteamento Semântico Condicionado pelo Desfoque e Fusão Explícita de Frequências
CogSENet: Blind Image Deblurring with Blur-Conditioned Semantic Routing and Explicit Frequency Fusion
June 29, 2026
Autores: Pan Wang, Yihao Hu, Xiujin Liu
cs.AI
Resumo
O deborrramento cego de imagens exige a recuperação de detalhes de alta fidelidade e estruturas coerentes a partir de degradações complexas e desconhecidas. Os métodos atuais de deborrramento cego de imagens enfrentam dificuldades com degradações reais e espacialmente variáveis e carecem da consciência semântica necessária para diferenciar de forma confiável texturas válidas de artefatos. Para preencher essa lacuna, propomos o CogSENet, um arcabouço de reconstrução dinâmico e alinhado semanticamente inspirado no sistema visual da águia. Ao imitar a varredura sacádica ativa da águia, desenvolvemos um Módulo de Espaço de Estados Orientado Semanticamente (SDSSM) com reagrupamento de tokens com consciência semântica por meio de roteamento diferenciável, permitindo a modelagem de dependências de longo alcance condicionadas a prompts. Para garantir a recuperação fisicamente interpretável de texturas e estruturas, um Bloco de Fusão Bifrequencial (BFFB) reflete a diferenciação funcional da retina da águia ao decompor características em altas e baixas frequências usando transformadas wavelet. Finalmente, estimamos um Campo de Desfoque Contínuo (CBF) a partir da imagem borrada e o fundimos com priors semânticos do CLIP para modular as características latentes mais profundas, emulando a adaptação focal e permitindo a restauração adaptativa sob desfoque espacialmente não uniforme. Experimentos extensivos demonstram que o CogSENet supera os métodos de deborrramento do estado da arte tanto em qualidade visual quanto em fidelidade estrutural com menos parâmetros, enquanto também apresenta desempenho favorável em tarefas de desembaçamento, remoção de chuva e remoção de ruído.
English
Blind image deblurring demands the recovery of high-fidelity details and coherent structures from complex, unknown degradations. Current blind image deblurring methods struggle with real-world, spatially varying degradations, and lack the semantic awareness necessary to reliably differentiate valid textures from artifacts. To bridge this gap, we propose CogSENet, a dynamic, semantic-aligned reconstruction framework inspired by the eagle's visual system. By mimicking the eagle's active saccadic scanning, we devise a Semantic-Driven State Space Module (SDSSM) with semantic-aware token regrouping via differentiable routing, enabling prompt-conditioned long-range dependency modeling. To ensure physically interpretable recovery of textures and structures, a BiFreqFusionBlock (BFFB) mirrors functional differentiation of the eagle's retina by decomposing features into high and low frequencies using wavelet transforms. Finally, we estimate a continuous Blur Field (CBF) from blur image and fuse it with CLIP semantic priors to modulate the deepest latent features, emulating focal adaptation and enabling adaptive restoration under spatially non-uniform blur. Extensive experiments demonstrate that CogSENetoutperforms state-of-the-art deblurring methods in both visual quality and structural fidelity with fewer parameters, while also performing favorably on dehazing, deraining, and denoising tasks.