F-GRPO : Optimisation de politique factorisée relative au groupe pour la génération et le classement unifiés des candidats
F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking
May 13, 2026
Auteurs: Rohan Surana, Gagan Mundada, Junda Wu, Xintong Li, Yizhu Jiao, Bowen Jin, Sizhe Zhou, Tong Yu, Ritwik Sinha, Jiawei Han, Jingbo Shang, Julian McAuley
cs.AI
Résumé
Les pipelines de recherche traditionnels optimisent l'utilité à travers des étapes de récupération de candidats et de reclassement, où le reclassement opère sur un ensemble de candidats prédéfini. Les grands modèles de langage (LLM) élargissent cette approche en un processus génératif : à partir d'un pool de candidats, un LLM peut générer un sous-ensemble et l'ordonner en un seul passage autorégressif. Cependant, cette flexibilité introduit un nouveau défi d'optimisation : le modèle doit explorer un espace de sortie combinatoire tout en ne recevant un retour d'utilité qu'après la génération complète de la liste classée. Étant donné que ce retour est défini sur la séquence terminée, il ne permet pas de distinguer si un mauvais résultat provient d'un échec à générer un sous-ensemble pertinent ou d'un échec à classer correctement ce sous-ensemble. Ce fossé d'attribution du crédit rend l'optimisation de bout en bout instable et inefficace en termes d'échantillons. Les systèmes existants traitent souvent ce problème en séparant la génération de candidats du reclassement. Cependant, un tel découplage reste mal aligné avec l'utilité en aval, car le reclassement est limité par l'ensemble de candidats qu'il reçoit. Pour combler ce fossé, nous proposons un cadre unifié qui effectue les deux opérations en un seul déroulé autorégressif et les optimise de bout en bout via une optimisation factorisée de politique relative au groupe (F-GRPO). Notre cadre factorise la politique en génération de candidats et reclassement tout en partageant une seule architecture de LLM, et les entraîne conjointement avec une récompense de couverture invariante à l'ordre et une récompense d'utilité sensible à la position. Pour résoudre le problème d'attribution du crédit spécifique à chaque phase, nous utilisons des avantages relatifs au groupe distincts pour la génération et le reclassement au sein d'un objectif au niveau de la séquence en deux phases. Sur les benchmarks de recommandation séquentielle et de réponse à questions multi-sauts, F-GRPO améliore les performances des premiers rangs par rapport à GRPO et aux références découplées, surpasse les alternatives supervisées, et reste compétitif avec de puissants reclasseurs zero-shot, sans aucun changement architectural au moment de l'inférence.
English
Traditional retrieval pipelines optimize utility through stages of candidate retrieval and reranking, where ranking operates over a predefined candidate set. Large Language Models (LLMs) broaden this into a generative process: given a candidate pool, an LLM can generate a subset and order it within a single autoregressive pass. However, this flexibility introduces a new optimization challenge: the model must search a combinatorial output space while receiving utility feedback only after the full ranked list is generated. Because this feedback is defined over the completed sequence, it cannot distinguish whether a poor result arises from failing to generate a relevant subset or from failing to rank that subset correctly. This credit assignment gap makes end-to-end optimization unstable and sample-inefficient. Existing systems often address this by separating candidate generation from ranking. However, such decoupling remains misaligned with downstream utility because ranking is limited by the candidate set it receives. To bridge this gap, we propose a unified framework that performs both within a single autoregressive rollout and optimizes them end-to-end via factorized group-relative policy optimization (F-GRPO). Our framework factorizes the policy into candidate generation and ranking while sharing a single LLM backbone, and jointly trains them with an order-invariant coverage reward and a position-aware utility reward. To address the resulting phase-specific credit assignment problem, we use separate group-relative advantages for generation and ranking within a two-phase sequence-level objective. Across sequential recommendation and multi-hop question answering benchmarks, F-GRPO improves top-ranked performance over GRPO and decoupled baselines, outperforms supervised alternatives, and remains competitive with strong zero-shot rerankers, with no architectural changes at inference time.