Rumo à Evolução de Dados On-Policy para Agentes de Busca Profunda Multimodais Visual-Nativos
Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents
May 11, 2026
Autores: Shijue Huang, Hangyu Guo, Chenxin Li, Junting Lu, Xinyu Geng, Zhaochen Su, Zhenyu Li, Shuang Chen, Hongru Wang, Yi R. Fung
cs.AI
Resumo
A busca profunda multimodal exige que um agente resolva problemas de mundo aberto encadeando busca, uso de ferramentas e raciocínio visual sobre um contexto textual e visual em evolução. Dois gargalos limitam os sistemas atuais. Primeiro, as estruturas de uso de ferramentas existentes tratam as imagens retornadas pela busca, navegação ou transformação como saídas transitórias, de modo que evidências visuais intermediárias não podem ser reutilizadas por ferramentas posteriores. Segundo, os dados de treinamento geralmente são construídos por receitas fixas de curadoria que não conseguem acompanhar a capacidade em evolução do agente alvo. Para enfrentar esses desafios, introduzimos primeiro uma estrutura de agente nativa visual centrada em um protocolo de referência de banco de imagens, que registra cada imagem retornada por ferramenta como uma referência endereçável e torna as evidências visuais intermediárias reutilizáveis por ferramentas posteriores. Sobre essa estrutura, a Evolução de Dados On-policy (ODE) executa um gerador de dados em malha fechada que se refina ao longo das rodadas a partir das execuções da política sendo treinada. Esse refinamento por rodada faz com que os dados de cada rodada visem aquilo que a política atual ainda precisa aprender. A mesma estrutura suporta tanto dados diversos de ajuste fino supervisionado quanto curadoria de dados de aprendizado por reforço consciente da política, cobrindo todo o ciclo de treinamento do agente alvo. Em 8 benchmarks de busca profunda multimodal, a ODE melhora o agente Qwen3-VL-8B de 24,9% para 39,0% em média, superando o Gemini-2.5 Pro no cenário padrão de fluxo de trabalho de agente (37,9%). Com 30B, a ODE eleva a pontuação média de 30,6% para 41,5%. Análises adicionais validam a eficácia da reutilização do banco de imagens, especialmente em tarefas complexas que exigem refinamento visual iterativo, enquanto a evolução com feedback de execuções produz traços de SFT mais fundamentados e tarefas de RL mais compatíveis com a política do que a síntese estática.
English
Multimodal deep search requires an agent to solve open-world problems by chaining search, tool use, and visual reasoning over evolving textual and visual context. Two bottlenecks limit current systems. First, existing tool-use harnesses treat images returned by search, browsing, or transformation as transient outputs, so intermediate visual evidence cannot be re-consumed by later tools. Second, training data is usually built by fixed curation recipes that cannot track the target agent's evolving capability. To address these challenges, we first introduce a visual-native agent harness centered on an image bank reference protocol, which registers every tool-returned image as an addressable reference and makes intermediate visual evidence reusable by later tools. On top of this harness, On-policy Data Evolution (ODE) runs a closed-loop data generator that refines itself across rounds from rollouts of the policy being trained. This per-round refinement makes each round's data target what the current policy still needs to learn. The same framework supports both diverse supervised fine-tuning data and policy-aware reinforcement learning data curation, covering the full training lifecycle of the target agent. Across 8 multimodal deep search benchmarks, ODE improves the Qwen3-VL-8B agent from 24.9% to 39.0% on average, surpassing Gemini-2.5 Pro in standard agent-workflow setting (37.9%). At 30B, ODE raises the average score from 30.6% to 41.5%. Further analyses validate the effectiveness of image-bank reuse, especially on complex tasks requiring iterative visual refinement, while rollout-feedback evolution yields more grounded SFT traces and better policy-matched RL tasks than static synthesis.