VideoSearch-R1: Iteratief Videoretrieval en Redeneren via Zachte Queryverfijning
VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement
July 1, 2026
Auteurs: Seohyun Lee, Seoung Choi, Dohwan Ko, Jongha Kim, Hyunwoo J. Kim
cs.AI
Samenvatting
Naarmate videocorpora blijven groeien in zowel omvang als taakcomplexiteit, neemt de vraag toe naar benaderingen die relevante video's uit grootschalige corpora kunnen terugvinden (inter-video redeneren) en vervolgens fijnmazige, query-afhankelijke taken (intra-video redeneren) kunnen uitvoeren binnen de teruggevonden inhoud, zoals temporele verankering. Bestaande benaderingen behandelen retrieval echter doorgaans als een voorbewerkingsstap, waardoor er, wanneer de initiële retrieval mislukt, geen mechanisme is om de zoekopdracht te verfijnen, wat leidt tot het falen van het daaropvolgende fijnmazige intra-video redeneren. Bovendien, hoewel recente agentische raamwerken het video begrip hebben verbeterd, veronderstellen ze doorgaans dat de query-relevante video al gegeven is en richten ze zich uitsluitend op intra-video redeneertaken. Om deze beperkingen aan te pakken, stellen we VideoSearch-R1 voor, een agentisch raamwerk voor iteratieve video retrieval en redeneren via meerstaps interactie met een video zoekmachine. Specifiek introduceren we Soft Query Refinement (SQR) om zoekquerytokens te verfijnen in een continue latente ruimte in plaats van queries te herschrijven in de discrete tekstruimte, wat efficiëntere en fijnmazigere aanpassingen mogelijk maakt. SQR en het bijbehorende redeneerproces worden getraind met Group Relative Policy Optimization (GRPO), gestuurd door taakniveau beloningssignalen afkomstig van retrieval en downstream taken. Hierop voortbouwend behaalt VideoSearch-R1 state-of-the-art prestaties op drie datasets voor Video Corpus Moment Retrieval (VCMR), waarbij het iteratief video's uit grootschalige corpora terugvindt, zoekqueries verfijnt en precieze query-afhankelijke temporele verankering uitvoert binnen de teruggevonden inhoud. Onze analyses tonen aan dat SQR de oorspronkelijke query effectief verfijnt en daarbij aanzienlijk minder gegenereerde tokens vereist dan expliciete tekstuele queryverfijning. Code en modelcheckpoints zijn openbaar beschikbaar op mlvlab.github.io/VideoSearch-R1.
English
As video corpora continue to expand in both scale and task complexity, there is increasing demand for approaches that retrieve relevant videos from large-scale corpora (inter-video reasoning) and subsequently perform fine-grained, query-conditioned tasks (intra-video reasoning) within the retrieved content, such as temporal grounding. However, existing approaches typically treat retrieval as a preprocessing step, and consequently, when the initial retrieval fails, there is no mechanism to refine the search, leading to the failure of subsequent fine-grained intra-video reasoning. Moreover, while recent agentic frameworks have advanced video understanding, they typically assume that the query-relevant video is already given, focusing exclusively on intra-video reasoning tasks. To address these limitations, we propose VideoSearch-R1, an agentic framework for iterative video retrieval and reasoning through multi-turn interaction with a video search engine. Specifically, we introduce Soft Query Refinement (SQR) to refine search query tokens in a continuous latent space rather than rewriting queries in the discrete text space, enabling more efficient and fine-grained adjustments. SQR and its reasoning process are trained using Group Relative Policy Optimization (GRPO), guided by task-level reward signals derived from retrieval and downstream tasks. Building upon this, VideoSearch-R1 achieves state-of-the-art performance across three datasets on Video Corpus Moment Retrieval (VCMR), iteratively retrieving videos from large-scale corpora, refining search queries, and performing precise query-conditioned temporal grounding within the retrieved content. Our analyses show that SQR effectively refines the original query, requiring significantly fewer generated tokens than explicit text-level query refinement. Code and model checkpoints are publicly available at mlvlab.github.io/VideoSearch-R1.