ChatPaper.aiChatPaper

VideoSearch-R1: Recuperação Iterativa de Vídeos e Raciocínio via Refinamento Suave de Consultas

VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement

July 1, 2026
Autores: Seohyun Lee, Seoung Choi, Dohwan Ko, Jongha Kim, Hyunwoo J. Kim
cs.AI

Resumo

À medida que os corpora de vídeo continuam a se expandir tanto em escala quanto em complexidade de tarefas, há uma demanda crescente por abordagens que recuperem vídeos relevantes de corpora de grande escala (raciocínio entre vídeos) e, subsequentemente, realizem tarefas refinadas e condicionadas à consulta (raciocínio intra-vídeo) dentro do conteúdo recuperado, como a fundamentação temporal. No entanto, abordagens existentes tipicamente tratam a recuperação como uma etapa de pré-processamento e, consequentemente, quando a recuperação inicial falha, não há mecanismo para refinar a busca, levando ao fracasso do raciocínio intra-vídeo refinado subsequente. Além disso, embora arcabouços agentivos recentes tenham avançado na compreensão de vídeos, eles geralmente assumem que o vídeo relevante à consulta já está dado, focando exclusivamente em tarefas de raciocínio intra-vídeo. Para lidar com essas limitações, propomos o VideoSearch-R1, um arcabouço agentivo para recuperação e raciocínio iterativos de vídeos por meio de interação em múltiplas etapas com um motor de busca de vídeos. Especificamente, introduzimos o Soft Query Refinement (SQR) para refinar os tokens de consulta de busca em um espaço latente contínuo, em vez de reescrever consultas no espaço textual discreto, permitindo ajustes mais eficientes e refinados. O SQR e seu processo de raciocínio são treinados usando Otimização de Política Relativa em Grupo (GRPO), guiados por sinais de recompensa ao nível da tarefa derivados da recuperação e das tarefas subsequentes. Com base nisso, o VideoSearch-R1 alcança desempenho de ponta em três conjuntos de dados na tarefa de Recuperação de Momento em Corpus de Vídeo (VCMR), recuperando iterativamente vídeos de corpora de grande escala, refinando consultas de busca e realizando fundamentação temporal precisa e condicionada à consulta dentro do conteúdo recuperado. Nossas análises mostram que o SQR refina efetivamente a consulta original, exigindo significativamente menos tokens gerados do que o refinamento explícito de consulta em nível textual. O código e os checkpoints do modelo estão disponíveis publicamente em mlvlab.github.io/VideoSearch-R1.
English
As video corpora continue to expand in both scale and task complexity, there is increasing demand for approaches that retrieve relevant videos from large-scale corpora (inter-video reasoning) and subsequently perform fine-grained, query-conditioned tasks (intra-video reasoning) within the retrieved content, such as temporal grounding. However, existing approaches typically treat retrieval as a preprocessing step, and consequently, when the initial retrieval fails, there is no mechanism to refine the search, leading to the failure of subsequent fine-grained intra-video reasoning. Moreover, while recent agentic frameworks have advanced video understanding, they typically assume that the query-relevant video is already given, focusing exclusively on intra-video reasoning tasks. To address these limitations, we propose VideoSearch-R1, an agentic framework for iterative video retrieval and reasoning through multi-turn interaction with a video search engine. Specifically, we introduce Soft Query Refinement (SQR) to refine search query tokens in a continuous latent space rather than rewriting queries in the discrete text space, enabling more efficient and fine-grained adjustments. SQR and its reasoning process are trained using Group Relative Policy Optimization (GRPO), guided by task-level reward signals derived from retrieval and downstream tasks. Building upon this, VideoSearch-R1 achieves state-of-the-art performance across three datasets on Video Corpus Moment Retrieval (VCMR), iteratively retrieving videos from large-scale corpora, refining search queries, and performing precise query-conditioned temporal grounding within the retrieved content. Our analyses show that SQR effectively refines the original query, requiring significantly fewer generated tokens than explicit text-level query refinement. Code and model checkpoints are publicly available at mlvlab.github.io/VideoSearch-R1.