ChatPaper.aiChatPaper

Naar on-policy data-evolutie voor visueel-native multimodale deep search agenten

Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents

May 11, 2026
Auteurs: Shijue Huang, Hangyu Guo, Chenxin Li, Junting Lu, Xinyu Geng, Zhaochen Su, Zhenyu Li, Shuang Chen, Hongru Wang, Yi R. Fung
cs.AI

Samenvatting

Multimodale diepe zoekopdracht vereist dat een agent open-wereldproblemen oplost door het aaneenschakelen van zoeken, toolgebruik en visuele redenering over evoluerende tekstuele en visuele context. Twee knelpunten beperken huidige systemen. Ten eerste behandelen bestaande toolgebruik-omkaderingen afbeeldingen die worden geretourneerd door zoeken, browsen of transformatie als tijdelijke uitvoer, waardoor tussentijds visueel bewijs niet opnieuw kan worden gebruikt door latere tools. Ten tweede wordt trainingsdata meestal opgebouwd door vaste curatierecepten die de evoluerende capaciteit van de doelagent niet kunnen volgen. Om deze uitdagingen aan te pakken, introduceren we eerst een visueel-native agentomkadering die is gecentreerd rond een beeldbankreferentieprotocol, dat elke door een tool geretourneerde afbeelding registreert als een adresseerbare referentie en tussentijds visueel bewijs herbruikbaar maakt voor latere tools. Bovenop deze omkadering voert On-policy Data Evolution (ODE) een gesloten-lus datagenerator uit die zichzelf over rondes verfijnt op basis van rollouts van het beleid dat wordt getraind. Deze per-ronde verfijning zorgt ervoor dat de data van elke ronde zich richt op wat het huidige beleid nog moet leren. Hetzelfde raamwerk ondersteunt zowel diverse data voor supervised fine-tuning als beleidsbewuste curatie van data voor reinforcement learning, waarmee de volledige trainingslevenscyclus van de doelagent wordt gedekt. Over 8 multimodale deep search-benchmarks verbetert ODE de Qwen3-VL-8B-agent van gemiddeld 24,9% naar 39,0%, waarmee het Gemini-2.5 Pro overtreft in de standaard agent-workflow-instelling (37,9%). Bij 30B verhoogt ODE de gemiddelde score van 30,6% naar 41,5%. Verdere analyses valideren de effectiviteit van beeldbankhergebruik, vooral bij complexe taken die iteratieve visuele verfijning vereisen, terwijl rollout-feedback-evolutie beter gefundeerde SFT-traces en beter op beleid afgestemde RL-taken oplevert dan statische synthese.
English
Multimodal deep search requires an agent to solve open-world problems by chaining search, tool use, and visual reasoning over evolving textual and visual context. Two bottlenecks limit current systems. First, existing tool-use harnesses treat images returned by search, browsing, or transformation as transient outputs, so intermediate visual evidence cannot be re-consumed by later tools. Second, training data is usually built by fixed curation recipes that cannot track the target agent's evolving capability. To address these challenges, we first introduce a visual-native agent harness centered on an image bank reference protocol, which registers every tool-returned image as an addressable reference and makes intermediate visual evidence reusable by later tools. On top of this harness, On-policy Data Evolution (ODE) runs a closed-loop data generator that refines itself across rounds from rollouts of the policy being trained. This per-round refinement makes each round's data target what the current policy still needs to learn. The same framework supports both diverse supervised fine-tuning data and policy-aware reinforcement learning data curation, covering the full training lifecycle of the target agent. Across 8 multimodal deep search benchmarks, ODE improves the Qwen3-VL-8B agent from 24.9% to 39.0% on average, surpassing Gemini-2.5 Pro in standard agent-workflow setting (37.9%). At 30B, ODE raises the average score from 30.6% to 41.5%. Further analyses validate the effectiveness of image-bank reuse, especially on complex tasks requiring iterative visual refinement, while rollout-feedback evolution yields more grounded SFT traces and better policy-matched RL tasks than static synthesis.