OpenSearch-VL: Uma Receita Aberta para Agentes de Busca Multimodal de Fronteira
OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
May 6, 2026
Autores: Shuang Chen, Kaituo Feng, Hangting Chen, Wenxuan Huang, Dasen Dai, Quanxin Shou, Yunlong Lin, Xiangyu Yue, Shenghua Gao, Tianyu Pang
cs.AI
Resumo
A busca profunda tornou-se uma capacidade crucial para agentes multimodais de fronteira, permitindo que os modelos resolvam questões complexas através de busca ativa, verificação de evidências e raciocínio em múltiplas etapas. Apesar do rápido progresso, os principais agentes de busca multimodal ainda são difíceis de reproduzir, em grande parte devido à ausência de dados de treinamento abertos de alta qualidade, pipelines transparentes de síntese de trajetórias ou receitas de treinamento detalhadas. Para isso, introduzimos o OpenSearch-VL, uma receita totalmente de código aberto para treinar agentes de busca profunda multimodal de fronteira com aprendizagem por reforço agentiva. Primeiro, criamos um pipeline dedicado para construir dados de treinamento de alta qualidade através de amostragem de caminhos da Wikipedia, reescrita difusa de entidades e aterramento visual de fonte-âncora, o que reduz conjuntamente atalhos e o colapso de recuperação em uma etapa. Com base neste pipeline, criamos dois conjuntos de dados de treinamento: SearchVL-SFT-36k para SFT e SearchVL-RL-8k para RL. Além disso, projetamos um ambiente de ferramentas diversificado que unifica busca de texto, busca de imagem, OCR, recorte, nitidez, super-resolução e correção de perspectiva, permitindo que os agentes combinem perceção ativa com a aquisição de conhecimento externo. Finalmente, propomos um algoritmo de treinamento GRPO fatal-aware multi-turn que lida com falhas em cascata de ferramentas, mascarando tokens pós-falha, enquanto preserva o raciocínio útil pré-falha através de uma fixação unilateral de vantagem. Construído sobre esta receita, o OpenSearch-VL oferece ganhos substanciais de desempenho, com melhorias médias superiores a 10 pontos em sete benchmarks, e alcança resultados comparáveis a modelos comerciais proprietários em várias tarefas. Liberaremos todos os dados, códigos e modelos para apoiar a pesquisa aberta em agentes de busca profunda multimodal.
English
Deep search has become a crucial capability for frontier multimodal agents, enabling models to solve complex questions through active search, evidence verification, and multi-step reasoning. Despite rapid progress, top-tier multimodal search agents remain difficult to reproduce, largely due to the absence of open high-quality training data, transparent trajectory synthesis pipelines, or detailed training recipes. To this end, we introduce OpenSearch-VL, a fully open-source recipe for training frontier multimodal deep search agents with agentic reinforcement learning. First, we curated a dedicated pipeline to construct high-quality training data through Wikipedia path sampling, fuzzy entity rewriting, and source-anchor visual grounding, which jointly reduce shortcuts and one-step retrieval collapse. Based on this pipeline, we curate two training datasets, SearchVL-SFT-36k for SFT and SearchVL-RL-8k for RL. Besides, we design a diverse tool environment that unifies text search, image search, OCR, cropping, sharpening, super-resolution, and perspective correction, enabling agents to combine active perception with external knowledge acquisition. Finally, we propose a multi-turn fatal-aware GRPO training algorithm that handles cascading tool failures by masking post-failure tokens while preserving useful pre-failure reasoning through one-sided advantage clamping. Built on this recipe, OpenSearch-VL delivers substantial performance gains, with over 10-point average improvements across seven benchmarks, and achieves results comparable to proprietary commercial models on several tasks. We will release all data, code, and models to support open research on multimodal deep search agents.