ChatPaper.aiChatPaper

GridProbe : Sondage a posteriori pour le calcul adaptatif au moment du test dans les VLM pour vidéos longues

GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs

May 11, 2026
Auteurs: Mohamed Eltahir, Lama Ayash, Ali Habibullah, Tanveer Hussain, Naeemullah Khan
cs.AI

Résumé

La compréhension de vidéos longues dans les VLMs est limitée par un seul passage avant monolithique sur des milliers de trames avec un coût d'attention quadratique. Une atténuation courante consiste d'abord à sélectionner un petit sous-ensemble de trames informatives avant le passage avant ; cela est fréquent pour les sélecteurs sans entraînement via des similarités auxiliaires dans l'espace des encodeurs. Ces signaux sont plafonnés par le pré-entraînement contrastif, qui échoue généralement sur les requêtes à fort raisonnement (négation, comptage inter-trames, résumé holistique). Nous proposons GridProbe, un paradigme d'inférence par sondage a posteriori efficace et sans entraînement, qui évalue les preuves dans l'espace des réponses en utilisant le propre raisonnement d'un VLM figé, puis sélectionne de manière adaptative les trames pertinentes pour la question, ce qui donne un coût d'attention sous-quadratique avec peu ou pas de perte de précision. Nous disposons les trames sur une grille K×K et exécutons des sondes légères de lignes R et de colonnes C, chaque sonde lisant son maximum a posteriori comme une confiance conditionnée par la requête. Le produit extérieur de R et C produit une carte d'importance interprétable dont l'asymétrie et l'aplatissement pilotent la sélection adaptative à la forme, une règle de forme fermée qui remplace de manière fiable le budget fixe de trames M par un M_eff par question. Nous montrons empiriquement que M_eff suit la difficulté intrinsèque de la question sans jamais voir la réponse, un signe de calcul adaptatif au moment du test. Sur Video-MME-v2, GridProbe atteint la baseline monolithique à moins de 1,6 pp de précision moyenne pour une réduction de 3,36× des TFLOPs, tandis que sur LongVideoBench, il domine la baseline au sens de Pareto (+0,9 pp pour 0,35× du calcul). Le sélecteur et le modèle de Q/R pouvant être découplés, l'association d'un petit sélecteur 2B avec un modèle de Q/R plus fort de 4B ou 8B est strictement dominante au sens de Pareto par rapport à la baseline monolithique 2B (jusqu'à +4,0 pp pour 0,52× du calcul, en moyenne), sans ré-entraînement. Enfin, l'interprétabilité des cartes d'importance ouvre de futures voies pour les diagnostics comportementaux, l'ancrage et la distillation de sélection de trames.
English
Long-video understanding in VLMs is bottlenecked by a single monolithic forward pass over thousands of frames at quadratic attention cost. A common mitigation is to first select a small subset of informative frames before the forward pass; common for training-free selectors via auxiliary encoder-space similarities. Such signals are capped by contrastive pretraining, which usually fails on reasoning-heavy queries (negation, cross-frame counting, holistic summarization). We propose GridProbe, an efficient training-free posterior-probing inference paradigm that scores evidence in answer space using a frozen VLM's own reasoning and then selects question-relevant frames adaptively, resulting in sub-quadratic attention cost with little to no accuracy loss. We arrange frames on a K{times}K grid and run lightweight row R and column C probes, where each probe reads its peak posterior as a query-conditioned confidence. The outer product of R and C yields an interpretable importance map whose skewness and kurtosis drive Shape-Adaptive Selection, a closed-form rule that reliably replaces the fixed frame budget M with a per-question M_{eff}. We show empirically that M_{eff} tracks intrinsic question difficulty without ever seeing the answer, a sign of test-time adaptive compute. On Video-MME-v2, GridProbe matches the monolithic baseline within 1.6 pp Avg Acc at 3.36times TFLOPs reduction, while on LongVideoBench it Pareto-dominates the baseline (+0.9 pp at 0.35times compute). Because the selector and QA models can be decoupled, pairing a small 2B selector with a stronger 4B or 8B QA is strictly Pareto-dominant over the 2B monolithic baseline (up to +4.0 pp at 0.52times compute, on average), with no retraining. Finally, the interpretability of the importance maps opens future avenues for behavioral diagnostics, grounding, and frame-selection distillation.