ChatPaper.aiChatPaper

Um Forward Supera Dois: InnerZoom para Ancoragem de GUI Precisa e Eficiente

One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding

June 29, 2026
Autores: Chen Liu, Ling Chen, Hanzhang Zhou, Liangyu Chen, Chenglin Cai, Xin Yu, Steven Hoi, Yue Wang
cs.AI

Resumo

Métodos de ancoragem de GUI baseados em MLLM geralmente formulam a localização do alvo como geração autorregressiva de coordenadas, permitindo que os modelos aproveitem as fortes capacidades de compreensão semântica e de seguir instruções dos MLLMs. No entanto, essa formulação exige que o modelo retenha evidências do alvo em nível de região enquanto decodifica tokens de coordenadas com a precisão espacial exigida para cliques em GUI. Nossa análise diagnóstica revela que a consciência da região-alvo emerge nas camadas intermediárias do decodificador, mas não é retida nem traduzida na predição final de coordenadas. Métodos existentes do tipo ZoomIn abordam esse problema por meio de uma passagem externa de recorte e reexecução, que melhora a localização, mas aumenta a latência ponta a ponta e o custo computacional. Para reter os benefícios de precisão do zoom de duas passagens sem esse custo extra, propomos o InnerZoom, uma estrutura de passagem única para ponte de evidência entre camadas. O InnerZoom transforma pistas relacionadas ao alvo da passagem direta original em um estado compacto de evidência entre camadas, depois preserva, refina e reinjeta esse estado ao longo das camadas posteriores do decodificador para guiar a predição de coordenadas. Resultados experimentais extensos sugerem que o InnerZoom-4B alcança desempenho de última geração em todos os seis benchmarks de ancoragem de GUI, obtendo 64,7 no OSWorld-G, 40,2 no UI-Vision, 73,1 no OSWorld-GR e 87,6 no MMBench-GUI, superando os melhores resultados anteriores em 4,1, 3,2, 2,9 e 2,3 pontos, respectivamente. Em um cenário controlado de 4B, o InnerZoom melhora a mesma linha de base SFT+RL em 5,3 pontos em média e supera o ZoomIn de duas passagens em 1,3 pontos em média, ao mesmo tempo que reduz a latência ponta a ponta em até 31,8% e os TFLOPs em cerca de 29%. Código e modelos serão disponibilizados publicamente.
English
MLLM-based GUI grounding methods commonly formulate target localization as autoregressive coordinate generation, enabling models to leverage the strong instruction-following and semantic understanding capabilities of MLLMs. However, this formulation requires the model to retain region-level target evidence while decoding coordinate tokens with the spatial precision demanded by GUI clicking. Our diagnostic analysis reveals that target-region awareness emerges in intermediate decoder layers but is neither retained nor translated into the final coordinate prediction. Existing ZoomIn-style methods address this issue through an external crop-and-rerun pass, which improves localization but increases end-to-end latency and computational cost. To retain the accuracy benefits of two-pass zooming without this extra cost, we propose InnerZoom, a single-forward framework for cross-layer evidence bridging. InnerZoom transforms target-related cues from the original forward pass into a compact cross-layer evidence state, then preserves, refines, and reinjects this state throughout later decoding layers to guide coordinate prediction. Extensive experimental results suggest that InnerZoom-4B achieves state-of-the-art performance on all six GUI grounding benchmarks, obtaining 64.7 on OSWorld-G, 40.2 on UI-Vision, 73.1 on OSWorld-GR, and 87.6 on MMBench-GUI, surpassing the previous best results by 4.1, 3.2, 2.9, and 2.3 points, respectively. Under a controlled 4B setting, InnerZoom improves the same SFT+RL baseline by 5.3 points on average and outperforms two-pass ZoomIn by 1.3 points on average, while reducing end-to-end latency by up to 31.8% and TFLOPs by about 29%. Code and models will be publicly available.