ChatPaper.aiChatPaper

Geração Segura em Poucos Passos via Edição de Velocidade

Safe Few-Step Generation via Velocity Editing

June 22, 2026
Autores: Yujin Choi, Jaehong Yoon
cs.AI

Resumo

O flow matching emergiu recentemente como um paradigma forte para a geração de texto-para-imagem (T2I) de ponta, permitindo a geração de alta qualidade com um pequeno número de etapas de amostragem. À medida que esses modelos são cada vez mais integrados em aplicações do mundo real, garantir a geração de conteúdo seguro e não sensível tornou-se um requisito crítico. No entanto, adaptar métodos de segurança e remoção de conceitos a este novo arcabouço de geração permanece um desafio em aberto. Especificamente, métodos anteriores dependem em grande parte do direcionamento iterativo da trajetória ao longo de várias etapas de remoção de ruído ou da manipulação da incorporação do prompt centrada em CLIP. Essas suposições de projeto impõem gargalos fundamentais para a segurança na geração T2I baseada em flow matching, onde as etapas limitadas de amostragem restringem a correção iterativa e os codificadores de texto modernos cientes do contexto diminuem a eficácia das intervenções no nível da incorporação. Neste artigo, propomos o VESFlow, um método de segurança sem treinamento adaptado ao flow matching com extremamente poucas etapas de amostragem. Aproveitando o fato de que modelos de flow matching aprendem a velocidade marginal, editamos diretamente o campo de velocidade por meio de um posterior condicional seguro. O VESFlow direciona a trajetória para saídas seguras enquanto mantém o prompt condicionante inalterado. Com base na observação de que o VESFlow mantém as saídas inalteradas sob prompts benignos, introduzimos ainda uma filtragem baseada em pontuação de risco que ignora a edição de velocidade para reduzir o custo computacional enquanto preserva a geração de prompts benignos. Com base nessa filtragem, propomos o VESFlow+, uma variante mais forte do VESFlow que não apenas edita a velocidade na direção segura, mas também a afasta da direção insegura. Resultados experimentais mostram que o VESFlow+ remove o conceito alvo, reduzindo a taxa de sucesso de ataque pelo NudeNet para 6,3% no Ring-A-Bell e 6,8% no MMA-Diffusion no modelo MeanFlow de 4 etapas, enquanto preserva a fidelidade em prompts benignos.
English
Flow matching has recently emerged as a strong paradigm for state-of-the-art text-to-image (T2I) generation, enabling high-quality generation with a small number of sampling steps. As these models are increasingly integrated into real-world applications, ensuring safe and non-sensitive content generation has become a critical requirement. However, adapting safety and concept removal methods to this new generation framework remains an open challenge. Specifically, prior methods largely rely on iterative trajectory steering across a number of denoising steps or on CLIP-centric prompt embedding manipulation. These design assumptions pose fundamental bottlenecks for safety in flow matching-based T2I generation, where limited sampling steps constrain iterative correction and modern context-aware text encoders diminish the effectiveness of embedding-level interventions. In this paper, we propose VESFlow, a training-free safety method tailored to flow matching with extremely few sampling steps. Leveraging the fact that flow matching models learn the marginal velocity, we directly edit the velocity field via a safe-conditional posterior. VESFlow steers the trajectory toward safe outputs while leaving the conditioning prompt unchanged. Building on the observation that VESFlow leaves outputs unchanged under benign prompts, we further introduce a risk score-based filtering that bypasses velocity editing to reduce computational cost while preserving benign prompt generation. Based on this filtering, we propose VESFlow+, a stronger variant of VESFlow that not only edits the velocity toward the safe direction, but also pushes it away from the unsafe direction. Experimental results show that VESFlow+ removes the target concept, reducing the attack success rate by NudeNet to 6.3% on Ring-A-Bell and 6.8% on MMA-Diffusion on the 4-step MeanFlow model, while preserving fidelity on benign prompts.