HyperEyes: Aprendizagem por Reforço com Dupla Granularidade e Consciência de Eficiência para Agentes de Busca Multimodal Paralelos
HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents
May 8, 2026
Autores: Guankai Li, Jiabin Chen, Yi Xu, Xichen Zhang, Yuan Lu
cs.AI
Resumo
Agentes de busca multimodais existentes processam entidades-alvo sequencialmente, realizando uma chamada de ferramenta por entidade e acumulando rodadas de interação redundantes sempre que uma consulta se decompõe em sub-recuperações independentes. Argumentamos que agentes multimodais eficazes devem buscar de forma mais ampla, e não mais longa: despachando múltiplas consultas fundamentadas simultaneamente dentro de uma rodada. Para isso, apresentamos HyperEyes, um agente de busca multimodal paralelo que funde ancoragem visual e recuperação em uma única ação atômica, permitindo busca concorrente em múltiplas entidades enquanto trata a eficiência de inferência como um objetivo de treinamento de primeira classe. O HyperEyes é treinado em dois estágios. Para supervisão de inicialização a frio, desenvolvemos um Pipeline de Síntese de Dados Paralelizável, abrangendo consultas visuais de múltiplas entidades e textuais de múltiplas restrições, curando trajetórias orientadas à eficiência por meio de Amostragem por Rejeição Progressiva. Com base nisso, nossa contribuição central, um framework de Aprendizado por Reforço Consciente de Eficiência em Duas Escalas, opera em dois níveis. No nível macro, propomos TRACE (Eficiência de Custo Adaptativa à Referência de Uso de Ferramenta), uma recompensa no nível da trajetória cuja referência é monotonicamente ajustada durante o treinamento para suprimir chamadas de ferramenta supérfluas sem restringir a busca genuína de múltiplos saltos. No nível micro, adaptamos a Destilação On-Policy para injetar sinais corretivos densos no nível dos tokens provenientes de um professor externo em rollouts fracassados, mitigando a deficiência de atribuição de crédito das recompensas esparsas de resultado. Como os benchmarks existentes avaliam apenas a acurácia como métrica, omitindo o custo de inferência, introduzimos IMEB, um benchmark curado por humanos com 300 instâncias que avalia conjuntamente capacidade de busca e eficiência. Em seis benchmarks, o HyperEyes-30B supera o agente de código aberto comparável mais forte em 9,9% na acurácia, com 5,3 vezes menos rodadas de chamada de ferramenta em média.
English
Existing multimodal search agents process target entities sequentially, issuing one tool call per entity and accumulating redundant interaction rounds whenever a query decomposes into independent sub-retrievals. We argue that effective multimodal agents should search wider rather than longer: dispatching multiple grounded queries concurrently within a round. To this end, we present HyperEyes, a parallel multimodal search agent that fuses visual grounding and retrieval into a single atomic action, enabling concurrent search across multiple entities while treating inference efficiency as a first-class training objective. HyperEyes is trained in two stages. For cold-start supervision, we develop a Parallel-Amenable Data Synthesis Pipeline covering visual multi-entity and textual multi-constraint queries, curating efficiency-oriented trajectories via Progressive Rejection Sampling. Building on this, our central contribution, a Dual-Grained Efficiency-Aware Reinforcement Learning framework, operates at two levels. At the macro level, we propose TRACE (Tool-use Reference-Adaptive Cost Efficiency), a trajectory-level reward whose reference is monotonically tightened during training to suppress superfluous tool calls without restricting genuine multi-hop search. At the micro level, we adapt On-Policy Distillation to inject dense token-level corrective signals from an external teacher on failed rollouts, mitigating the credit-assignment deficiency of sparse outcome rewards. Since existing benchmarks evaluate accuracy as the sole metric, omitting inference cost, we introduce IMEB, a human-curated benchmark of 300 instances that jointly evaluates search capability and efficiency. Across six benchmarks, HyperEyes-30B surpasses the strongest comparable open-source agent by 9.9% in accuracy with 5.3x fewer tool-call rounds on average.