Eén Forward Verslaat Twee: InnerZoom voor Nauwkeurige en Efficiënte GUI-Grounding
One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding
June 29, 2026
Auteurs: Chen Liu, Ling Chen, Hanzhang Zhou, Liangyu Chen, Chenglin Cai, Xin Yu, Steven Hoi, Yue Wang
cs.AI
Samenvatting
Op MLLM gebaseerde GUI-ankeringsmethoden formuleren doellokalisatie vaak als autoregressieve coördinaatgeneratie, waardoor modellen de sterke instructievolg- en semantische begripscapaciteiten van MLLM's kunnen benutten. Deze formulering vereist echter dat het model regio-niveau doelelementen behoudt tijdens het decoderen van coördinaat-tokens met de ruimtelijke precisie die vereist is voor GUI-klikken. Onze diagnostische analyse toont aan dat doelgebiedbesef ontstaat in intermediaire decoderlagen, maar niet wordt behouden of vertaald naar de uiteindelijke coördinaatvoorspelling. Bestaande ZoomIn-achtige methoden pakken dit probleem aan via een externe bijsnijd-en-heraanroeppass, wat de lokalisatie verbetert maar de end-to-end latentie en rekenkosten verhoogt. Om de nauwkeurigheidsvoordelen van tweepassig inzoomen te behouden zonder deze extra kosten, stellen we InnerZoom voor, een enkelvoudig doorstuurframework voor cross-layer bewijsoverbrugging. InnerZoom transformeert doelgerelateerde aanwijzingen uit de oorspronkelijke doorstuurpassage in een compacte cross-layer bewijstoestand, behoudt, verfijnt en injecteert deze toestand vervolgens opnieuw in latere decoderlagen om de coördinaatvoorspelling te sturen. Uitgebreide experimentele resultaten suggereren dat InnerZoom-4B state-of-the-art prestaties behaalt op alle zes GUI-ankeringsbenchmarks, met scores van 64,7 op OSWorld-G, 40,2 op UI-Vision, 73,1 op OSWorld-GR en 87,6 op MMBench-GUI, waarmee de vorige beste resultaten met respectievelijk 4,1, 3,2, 2,9 en 2,3 punten worden overtroffen. In een gecontroleerde 4B-omgeving verbetert InnerZoom dezelfde SFT+RL-baseline met gemiddeld 5,3 punten en presteert het gemiddeld 1,3 punten beter dan tweepassig ZoomIn, terwijl de end-to-end latentie met maximaal 31,8% en de TFLOPs met ongeveer 29% worden verminderd. Code en modellen zullen openbaar beschikbaar worden gesteld.
English
MLLM-based GUI grounding methods commonly formulate target localization as autoregressive coordinate generation, enabling models to leverage the strong instruction-following and semantic understanding capabilities of MLLMs. However, this formulation requires the model to retain region-level target evidence while decoding coordinate tokens with the spatial precision demanded by GUI clicking. Our diagnostic analysis reveals that target-region awareness emerges in intermediate decoder layers but is neither retained nor translated into the final coordinate prediction. Existing ZoomIn-style methods address this issue through an external crop-and-rerun pass, which improves localization but increases end-to-end latency and computational cost. To retain the accuracy benefits of two-pass zooming without this extra cost, we propose InnerZoom, a single-forward framework for cross-layer evidence bridging. InnerZoom transforms target-related cues from the original forward pass into a compact cross-layer evidence state, then preserves, refines, and reinjects this state throughout later decoding layers to guide coordinate prediction. Extensive experimental results suggest that InnerZoom-4B achieves state-of-the-art performance on all six GUI grounding benchmarks, obtaining 64.7 on OSWorld-G, 40.2 on UI-Vision, 73.1 on OSWorld-GR, and 87.6 on MMBench-GUI, surpassing the previous best results by 4.1, 3.2, 2.9, and 2.3 points, respectively. Under a controlled 4B setting, InnerZoom improves the same SFT+RL baseline by 5.3 points on average and outperforms two-pass ZoomIn by 1.3 points on average, while reducing end-to-end latency by up to 31.8% and TFLOPs by about 29%. Code and models will be publicly available.