GridProbe: Sondagem do Posterior para Computação Adaptativa em Tempo de Teste em VLMs de Vídeo Longo
GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs
May 11, 2026
Autores: Mohamed Eltahir, Lama Ayash, Ali Habibullah, Tanveer Hussain, Naeemullah Khan
cs.AI
Resumo
A compreensão de vídeos longos em VLMs é limitada por uma única passagem direta monolítica sobre milhares de quadros com custo de atenção quadrático. Uma mitigação comum é primeiro selecionar um pequeno subconjunto de quadros informativos antes da passagem direta; comum para seletores sem treinamento por meio de similaridades auxiliares no espaço do codificador. Tais sinais são limitados pelo pré-treinamento contrastivo, que geralmente falha em consultas com alto raciocínio (negação, contagem entre quadros, sumarização holística). Propomos o GridProbe, um paradigma eficiente de inferência por sondagem posterior sem treinamento que pontua evidências no espaço de respostas usando o próprio raciocínio de um VLM congelado e, em seguida, seleciona quadros relevantes à pergunta de forma adaptativa, resultando em custo de atenção subquadrático com pouca ou nenhuma perda de precisão. Organizamos os quadros em uma grade K×K e executamos sondas leves de linha R e coluna C, onde cada sonda lê seu pico posterior como uma confiança condicionada à consulta. O produto externo de R e C produz um mapa de importância interpretável cuja assimetria e curtose conduzem a Shape-Adaptive Selection, uma regra de forma fechada que substitui de forma confiável o orçamento fixo de quadros M por um M_{eff} por questão. Mostramos empiricamente que M_{eff} acompanha a dificuldade intrínseca da pergunta sem nunca ver a resposta, um sinal de computação adaptativa em tempo de teste. No Video-MME-v2, o GridProbe corresponde à linha de base monolítica dentro de 1,6 pp na Acurácia Média com redução de 3,36 vezes em TFLOPs, enquanto no LongVideoBench ele domina Pareto a linha de base (+0,9 pp com 0,35 vezes a computação). Como o seletor e os modelos de QA podem ser desacoplados, combinar um pequeno seletor de 2B com um QA mais robusto de 4B ou 8B é estritamente dominante em Pareto em relação à linha de base monolítica de 2B (até +4,0 pp com 0,52 vezes a computação, em média), sem re-treinamento. Por fim, a interpretabilidade dos mapas de importância abre caminhos futuros para diagnósticos comportamentais, ancoragem e destilação de seleção de quadros.
English
Long-video understanding in VLMs is bottlenecked by a single monolithic forward pass over thousands of frames at quadratic attention cost. A common mitigation is to first select a small subset of informative frames before the forward pass; common for training-free selectors via auxiliary encoder-space similarities. Such signals are capped by contrastive pretraining, which usually fails on reasoning-heavy queries (negation, cross-frame counting, holistic summarization). We propose GridProbe, an efficient training-free posterior-probing inference paradigm that scores evidence in answer space using a frozen VLM's own reasoning and then selects question-relevant frames adaptively, resulting in sub-quadratic attention cost with little to no accuracy loss. We arrange frames on a K{times}K grid and run lightweight row R and column C probes, where each probe reads its peak posterior as a query-conditioned confidence. The outer product of R and C yields an interpretable importance map whose skewness and kurtosis drive Shape-Adaptive Selection, a closed-form rule that reliably replaces the fixed frame budget M with a per-question M_{eff}. We show empirically that M_{eff} tracks intrinsic question difficulty without ever seeing the answer, a sign of test-time adaptive compute. On Video-MME-v2, GridProbe matches the monolithic baseline within 1.6 pp Avg Acc at 3.36times TFLOPs reduction, while on LongVideoBench it Pareto-dominates the baseline (+0.9 pp at 0.35times compute). Because the selector and QA models can be decoupled, pairing a small 2B selector with a stronger 4B or 8B QA is strictly Pareto-dominant over the 2B monolithic baseline (up to +4.0 pp at 0.52times compute, on average), with no retraining. Finally, the interpretability of the importance maps opens future avenues for behavioral diagnostics, grounding, and frame-selection distillation.