M2Retinexformer : Retinexformer multi-modal pour l'amélioration d'images en faible luminosité
M2Retinexformer: Multi-Modal Retinexformer for Low-Light Image Enhancement
May 11, 2026
Auteurs: Youssef Aboelwafa, Hicham G. Elmongui, Marwan Torki
cs.AI
Résumé
L'amélioration des images en faible luminosité est difficile en raison des dégradations complexes, incluant un bruit amplifié, des artefacts et une distorsion des couleurs. Alors que les méthodes d'apprentissage profond basées sur Retinex ont obtenu des résultats prometteurs, elles reposent principalement sur une information RGB mono-modale. Nous proposons M2Retinexformer (Multi-Modal Retinexformer), une nouvelle architecture qui étend Retinexformer en intégrant des indices de profondeur, des a priori de luminance et des caractéristiques sémantiques dans un pipeline de raffinement progressif. La profondeur fournit un contexte géométrique invariant aux variations d'éclairage, tandis que la luminance et les caractéristiques sémantiques offrent un guidage explicite sur la distribution de la luminosité et la compréhension de la scène. Les modalités sont extraites à plusieurs échelles et fusionnées par attention croisée, avec un mécanisme de pondération adaptative qui équilibre dynamiquement l'auto-attention guidée par l'illumination et l'attention croisée en fonction de la fiabilité des indices auxiliaires. Les évaluations sur les benchmarks LOL, SID, SMID et SDSD montrent des améliorations globales par rapport à Retinexformer et aux méthodes récentes de pointe. Le code et les poids pré-entraînés sont disponibles à l'adresse https://github.com/YoussefAboelwafa/M2Retinexformer.
English
Low-light image enhancement is challenging due to complex degradations, including amplified noise, artifacts, and color distortion. While Retinex-based deep learning methods have achieved promising results, they primarily rely on single-modality RGB information. We propose M2Retinexformer (Multi-Modal Retinexformer), a novel framework that extends Retinexformer by incorporating depth cues, luminance priors, and semantic features within a progressive refinement pipeline. Depth provides geometric context that is invariant to lighting variations, while luminance and semantic features offer explicit guidance on brightness distribution and scene understanding. Modalities are extracted at multiple scales and fused through cross-attention, with adaptive gating dynamically balancing illumination-guided self-attention and cross-attention based on the reliability of auxiliary cues. Evaluations on the LOL, SID, SMID, and SDSD benchmarks demonstrate overall improvements over Retinexformer and recent state-of-the-art methods. Code and pretrained weights are available at https://github.com/YoussefAboelwafa/M2Retinexformer