Pense, depois Pontue: Raciocínio e Pontuação Desacoplados para Modelagem de Recompensa em Vídeo
Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling
May 7, 2026
Autores: Yuan Wang, Ouxiang Li, Yulong Xu, Borui Liao, Jiajun Liang, Jinghan Li, Meng Wang, Xintao Wang, Pengfei Wang, Kuien Liu, Xiang Wang
cs.AI
Resumo
Os avanços recentes em modelos generativos de vídeo são cada vez mais impulsionados pela escalagem pós-treinamento e em tempo de teste, ambas dependendo criticamente da qualidade dos modelos de recompensa de vídeo (RMs). Um modelo de recompensa ideal deve prever recompensas precisas que estejam alinhadas com as preferências humanas em diversos cenários. No entanto, os paradigmas existentes enfrentam um dilema fundamental: Os RMs Discriminativos regridem recompensas diretamente sobre características extraídas por modelos de linguagem grandes multimodais (MLLMs) sem raciocínio explícito, tornando-os propensos ao aprendizado por atalhos e fortemente dependentes da escalagem massiva de dados para generalização. Em contraste, os RMs Generativos com raciocínio Chain-of-Thought (CoT) exibem potencial de interpretabilidade e generalização superiores, pois aproveitam a supervisão semântica de granularidade fina para internalizar as racionalidades por trás das preferências humanas. No entanto, eles sofrem com gargalos de otimização inerentes devido ao acoplamento do raciocínio e da pontuação dentro de uma única cadeia de inferência autoregressiva. Para aproveitar os benefícios de generalização do raciocínio CoT enquanto mitiga a instabilidade do treinamento causada pelo acoplamento entre raciocínio e pontuação, nós introduzimos o DeScore, um modelo de recompensa de vídeo eficiente em treinamento e generalizável. O DeScore emprega um paradigma desacoplado "pensar-depois-pontuar": um MLLM primeiro gera um CoT explícito, seguido por um módulo de pontuação discriminativo dedicado, consistindo de um token de consulta treinável e um cabeçalho de regressão que prevê a recompensa final. O DeScore é otimizado por meio de uma estrutura de duas etapas: (1) uma inicialização a frio discriminativa que incorpora um mecanismo de mascaramento aleatório para garantir capacidades robustas de pontuação, e (2) uma etapa de aprendizado por reforço de duplo objetivo que refina independentemente a qualidade do raciocínio CoT e calibra a recompensa final, garantindo que um raciocínio de maior qualidade se traduza diretamente em um desempenho superior do modelo.
English
Recent advances in generative video models are increasingly driven by post-training and test-time scaling, both of which critically depend on the quality of video reward models (RMs). An ideal reward model should predict accurate rewards that align with human preferences across diverse scenarios. However, existing paradigms face a fundamental dilemma: Discriminative RMs regress rewards directly on features extracted by multimodal large language models (MLLMs) without explicit reasoning, making them prone to shortcut learning and heavily reliant on massive data scaling for generalization. In contrast, Generative RMs with Chain-of-Thought (CoT) reasoning exhibit superior interpretability and generalization potential, as they leverage fine-grained semantic supervision to internalize the rationales behind human preferences. However, they suffer from inherent optimization bottlenecks due to the coupling of reasoning and scoring within a single autoregressive inference chain. To harness the generalization benefits of CoT reasoning while mitigating the training instability of coupled reasoning and scoring, we introduce DeScore, a training-efficient and generalizable video reward model. DeScore employs a decoupled ``think-then-score'' paradigm: an MLLM first generates an explicit CoT, followed by a dedicated discriminative scoring module consisting of a learnable query token and a regression head that predicts the final reward. DeScore is optimized via a two-stage framework: (1) a discriminative cold start incorporating a random mask mechanism to ensure robust scoring capabilities, and (2) a dual-objective reinforcement learning stage that independently refines CoT reasoning quality and calibrates the final reward, ensuring that higher-quality reasoning directly translates to superior model performance.