ChatPaper.aiChatPaper

Stable-Layers : Affinage de modèles de décomposition d'images en couches avec apprentissage par renforcement noté par VLM

Stable-Layers: Fine-Tuning Image Layer Decomposition Models with VLM-Scored Reinforcement Learning

May 28, 2026
Auteurs: Ciara Rowles, Reshinth Adithyan, Nikhil Pinnaparaju, Vikram Voleti, Mark Boss
cs.AI

Résumé

Nous présentons Stable-Layers, un cadre d'apprentissage par renforcement qui élimine le besoin de supervision appariée en affinant un modèle de décomposition de couches pré-entraîné à l'aide uniquement des retours d'un modèle vision-langage (VLM). En partant de Qwen-Image-Layered, nous appliquons Flow-GRPO avec adaptation LoRA, en échantillonnant plusieurs décompositions candidates par image, en les notant avec un VLM, et en optimisant la politique à partir des avantages relatifs au groupe. Le défi principal réside dans la conception d'un signal de récompense fiable : les VLM notant les échantillons de manière isolée ont tendance à compresser leurs jugements dans une bande étroite, laissant à GRPO peu de variance intra-groupe pour apprendre. Nous relevons ce défi avec un pipeline d'évaluation en deux étapes qui associe une notation structurée par échantillon selon cinq critères centrés sur l'édition à une étape de calibration basée sur une grille où le VLM renote tous les candidats côte à côte. Stable-Layers produit des décompositions avec une meilleure séparation des couches, moins de couches vides ou riches en artefacts, et une erreur de reconstruction par couche plus faible sur le jeu de données Crello par rapport au modèle de base.
English
We present Stable-Layers, a reinforcement learning framework that eliminates the need for paired supervision by fine-tuning a pretrained layer decomposition model using only feedback from a vision-language model (VLM). Starting from Qwen-Image-Layered, we apply Flow-GRPO with LoRA adaptation, sampling multiple candidate decompositions per image, scoring them with a VLM, and optimising the policy from group-relative advantages. The key challenge lies in designing a reliable reward signal: VLMs scoring samples in isolation tend to compress their judgements into a narrow band, leaving GRPO with little within-group variance to learn from. We address this with a two-stage evaluation pipeline that pairs structured per-sample scoring across five edit-centric criteria with a grid-based calibration step in which the VLM re-scores all candidates side-by-side. Stable-Layers produces decompositions with stronger layer separation, fewer blank or artifact-heavy layers, and lower per-layer reconstruction error on the Crello dataset compared to the base model.