ChatPaper.aiChatPaper

FreeStyle: Controle Livre da Geração com Dupla Referência de Estilo-Conteúdo a partir da Mineração de LoRA Comunitário

FreeStyle: Free Control of Style-Content Dual-Reference Generation from Community LoRA Mining

June 18, 2026
Autores: Jinghong Lan, Wei Cheng, Yunuo Chen, Ziqi Ye, Peng Xing, Yixiao Fang, Rui Wang, Yufeng Yang, Xuanyang Zhang, Xianfang Zeng, Difan Zou, Gang Yu, Chi Zhang
cs.AI

Resumo

Geração de dupla referência estilo-conteúdo visa sintetizar uma imagem que preserve a estrutura e a semântica de uma referência de conteúdo, ao mesmo tempo que adota o estilo de uma referência de estilo separada. Apesar dos avanços recentes, essa configuração permanece desafiadora, pois os modelos devem equilibrar fidelidade ao conteúdo, alinhamento de estilo e seguimento de instruções, evitando vazamento semântico da referência de estilo. Um gargalo fundamental é a falta de dados de tripletos em larga escala com separação limpa entre conteúdo e estilo e ampla cobertura de estilos de cauda longa. Neste trabalho, propomos o FreeStyle, uma estrutura escalável de geração de dupla referência baseada em mineração de LoRAs da comunidade. Tratamos os LoRAs da comunidade como âncoras composicionais para estilo e conteúdo, e projetamos um pipeline rigoroso de geração e filtragem para construir tripletos de Referência de Estilo e Referência de Conteúdo em larga escala, abrangendo múltiplos modelos base. Para lidar com o vazamento de conteúdo, adotamos um currículo de dois estágios com mecanismos de desvinculação específicos de cada estágio: uma restrição de enriquecimento no nível de atenção que suprime o vazamento da referência de estilo no estágio de transferência de estilo, e uma estratégia de modulação RoPE consciente da frequência que visa o vazamento baseado em correspondência posicional no estágio mais difícil de dupla referência. Também introduzimos um benchmark abrangendo tanto a geração de referência de estilo quanto a de dupla referência, com avaliações de similaridade de estilo, preservação de conteúdo, estética, seguimento de instruções e rejeição de vazamento. O benchmark incorpora uma Pontuação de Alinhamento de Conteúdo (CAS) invariante ao estilo e introduz uma Pontuação de Rejeição calibrada baseada em VLM para avaliar a confiabilidade da geração e a supressão de vazamento. Experimentos extensivos mostram que nosso modelo alcança um forte equilíbrio entre alinhamento de estilo, preservação de conteúdo e supressão de vazamento.
English
Style-content dual-reference generation aims to synthesize an image that preserves the structure and semantics of a content reference while adopting the style of a separate style reference.Despite recent progress, this setting remains challenging because models must balance content fidelity, style alignment, and instruction following avoiding semantic leakage from the style reference.A key bottleneck is the lack of large-scale triplet data with clean content-style separation and broad long-tail style coverage.In this work, we propose FreeStyle, a scalable dual-reference generation framework based on community LoRA mining.We treat community LoRAs as compositional anchors for style and content, and design a rigorous generation and filtering pipeline to construct large-scale Style-Reference and Content-Reference triplets across multiple base models.To address content leakage, we adopt a two-stage curriculum with stage-specific disentanglement mechanisms: an attention-level enrichment constraint that suppresses style-reference leakage in the style-transfer stage, and a frequency-aware RoPE modulation strategy that targets positional-correspondence-based leakage in the harder dual-reference stage.We also introduce a benchmark covering both style-reference and dual-reference generation, with evaluations on style similarity, content preservation, aesthetics, instruction following, and leakage rejection. The benchmark incorporates a style-invariant Content Alignment Score (CAS) and introduces a calibrated VLM-based Rejection Score for evaluating generation reliability and leakage suppression.Extensive experiments show that our model achieves a strong balance among style alignment, content preservation, and leakage suppression.