ChatPaper.aiChatPaper

InterLV-Search: Benchmarking de Busca Agente Multimodal Intercalada

InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

May 8, 2026
Autores: Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang
cs.AI

Resumo

Os benchmarks existentes para busca agentiva multimodal avaliam a busca multimodal e a navegação visual, mas a evidência visual está confinada à entrada ou tratada como um ponto final de resposta, em vez de parte de uma trajetória de busca intercalada. Apresentamos o InterLV-Search, um benchmark para Busca Agentiva Intercalada de Linguagem e Visão, no qual evidências textuais e visuais são repetidamente utilizadas para condicionar buscas posteriores. Ele contém 2.061 exemplos em três níveis: busca ativa por evidências visuais, busca multimodal intercalada offline controlada e busca multimodal intercalada na web aberta. Além dos benchmarks existentes, ele também inclui amostras multimodais de múltiplos ramos que envolvem comparação entre múltiplas entidades durante a busca de evidências. Construímos os Níveis 1 e 2 com pipelines automatizados e o Nível 3 com um pipeline de web aberta conduzido por máquina e supervisionado por humanos. Fornecemos também o InterLV-Agent para uso padronizado de ferramentas, registro de trajetórias e avaliação. Experimentos com agentes multimodais proprietários e de código aberto mostram que os sistemas atuais ainda estão longe de resolver a busca multimodal intercalada, com o melhor modelo apresentando precisão geral abaixo de 50%, destacando desafios na busca de evidências visuais, controle de busca e integração de evidências multimodais. Disponibilizamos os dados do benchmark e o código de avaliação em https://github.com/hbhalpha/InterLV-Search-Bench.
English
Existing benchmarks for multimodal agentic search evaluate multimodal search and visual browsing, but visual evidence is either confined to the input or treated as an answer endpoint rather than part of an interleaved search trajectory. We introduce InterLV-Search, a benchmark for Interleaved Language-Vision Agentic Search, in which textual and visual evidence is repeatedly used to condition later search. It contains 2,061 examples across three levels: active visual evidence seeking, controlled offline interleaved multimodal search, and open-web interleaved multimodal search. Beyond existing benchmarks, it also includes multimodal multi-branch samples that involve comparison between multiple entities during the evidence search. We construct Level 1 and Level 2 with automated pipelines and Level 3 with a machine-led, human-supervised open-web pipeline. We further provide InterLV-Agent for standardized tool use, trajectory logging, and evaluation. Experiments on proprietary and open-source multimodal agents show that current systems remain far from solving interleaved multimodal search, with the best model below 50% overall accuracy, highlighting challenges in visual evidence seeking, search control, and multimodal evidence integration. We release the benchmark data and evaluation code at https://github.com/hbhalpha/InterLV-Search-Bench