ChatPaper.aiChatPaper

Optimisation hors ligne des préférences pour le flux rectifié avec paires de suivi du bruit

Offline Preference Optimization for Rectified Flow with Noise-Tracked Pairs

May 10, 2026
Auteurs: Yunhong Lu, Qichao Wang, Hengyuan Cao, Xiaoyin Xu, Min Zhang
cs.AI

Résumé

Les ensembles de données de préférence existants pour les modèles texte-image stockent généralement uniquement les images gagnantes/perdantes finales. Cette représentation est insuffisante pour les modèles de flux rectifié (RF), dont la génération est naturellement indexée par un échantillon de bruit a priori spécifique et suit une trajectoire de débruitage quasi rectiligne. En revanche, les alignements antérieurs de type DPO pour les modèles de diffusion estiment généralement les trajectoires en utilisant un processus de bruitage direct indépendant, qui peut être mal adapté aux véritables dynamiques inverses et introduit une variance inutile. Nous proposons l'Optimisation de Préférence Sensible au Bruit A Priori (PNAPO), un cadre d'alignement hors politique spécialisé pour le flux rectifié. PNAPO augmente les données de préférence en conservant les bruits a priori appariés utilisés pour générer chaque image gagnante/perdante, transformant le triplet standard (invite, gagnant, perdant) en un sextuplet. En tirant parti de la propriété de ligne droite du RF, nous estimons les états intermédiaires via une interpolation bruit-image, ce qui contraint l'espace d'estimation de la trajectoire et produit un objectif de substitution plus serré pour l'optimisation des préférences. De plus, nous introduisons une stratégie de régularisation dynamique qui adapte la régularisation DPO en fonction (i) de l'écart de récompense entre le gagnant et le perdant et (ii) de la progression de l'entraînement, améliorant ainsi la stabilité et l'efficacité des échantillons. Les expériences sur les architectures T2I RF de pointe montrent que PNAPO améliore systématiquement les métriques de préférence tout en réduisant considérablement le calcul d'entraînement.
English
Existing preference datasets for text-to-image models typically store only the final winner/loser images. This representation is insufficient for rectified flow (RF) models, whose generation is naturally indexed by a specific prior noise sample and follows a nearly straight denoising trajectory. In contrast, prior DPO-style alignment for diffusion models commonly estimates trajectories using an independent forward noising process, which can be mismatched to the true reverse dynamics and introduces unnecessary variance. We propose Prior Noise-Aware Preference Optimization (PNAPO), an off-policy alignment framework specialized for rectified flow. PNAPO augments preference data by retaining the paired prior noises used to generate each winner/loser image, turning the standard (prompt, winner, loser) triplet into a sextuple. Leveraging the straight-line property of RF, we estimate intermediate states via noise-image interpolation, which constrains the trajectory estimation space and yields a tighter surrogate objective for preference optimization. In addition, we introduce a dynamic regularization strategy that adapts the DPO regularization based on (i) the reward gap between winner and loser and (ii) training progress, improving stability and sample efficiency. Experiments on state-of-the-art RF T2I backbones show that PNAPO consistently improves preference metrics while substantially reducing training compute.