ChatPaper.aiChatPaper

Orquestração de Ferramentas Ciente da Confiança para Compreensão Robusta de Vídeo

Confidence-Aware Tool Orchestration for Robust Video Understanding

June 25, 2026
Autores: Yangfan He, Yujin Choi, Jaehong Yoon
cs.AI

Resumo

Modelos de raciocínio de vídeo implicitamente assumem que todos os quadros de entrada são igualmente confiáveis. Isso leva ao que denominamos Problema da Confiança Cega: sob perturbações realistas como desfoque de movimento, ofuscamento ou oclusão, modelos de raciocínio de vídeo de ponta podem sofrer quedas de acurácia de 15 a 30 pontos percentuais (p.p.) em benchmarks incorporados de mundo real, permanecendo alheios ao fato de que sua evidência visual foi degradada. Para enfrentar esse desafio, propomos o Robust-TO, um framework agêntico de compreensão de vídeo que integra explicitamente a confiabilidade por quadro em todas as etapas do raciocínio. O Robust-TO organiza ferramentas heterogêneas de percepção visual sob uma interface unificada de evidências. Cada ferramenta recebe uma subconsulta derivada da pergunta original e um conjunto de quadros confiáveis selecionados pela pontuação de relevância-confiabilidade. Ela retorna evidências em um formato compartilhado: uma predição concreta (por exemplo, uma caixa delimitadora, trajetória de movimento, texto reconhecido ou rótulo de ação), ancoragem temporal e uma pontuação de confiabilidade calibrada. Durante o raciocínio, essas pontuações calibradas orientam a ponderação das evidências em um processo de síntese em três níveis (alto/médio/baixo) e definem uma recompensa GRPO de custo de confiança que otimiza conjuntamente a correção, a confiabilidade das evidências e a eficiência. Em dois benchmarks de raciocínio de vídeo abrangendo oito tarefas, o Robust-TO alcança 56,4% de acurácia média em entradas limpas, superando a linha de base de código aberto mais forte em 10,6 p.p. e superando o Gemini-2.5-Pro (46,2%). Sob cinco tipos realistas de corrupção, o Robust-TO mantém 54,3% de acurácia média, 5,8 p.p. acima da linha de base de código aberto mais forte, exibindo a menor queda de acurácia entre entradas limpas e corrompidas dentre todos os métodos comparados.
English
Video reasoning language models implicitly assume that every input frame is equally reliable. This leads to what we term the Blind Trust Problem: under realistic perturbations such as motion blur, glare, or occlusion, frontier video reasoning models can suffer 15-30%p accuracy drops on real-world embodied benchmarks, while remaining unaware that their visual evidence has been degraded. To address this challenge, we propose Robust-TO, an agentic video understanding framework that explicitly integrates per-frame trustworthiness into every stage of reasoning. Robust-TO organizes heterogeneous visual perception tools under a unified evidence interface. Each tool receives a sub-query derived from the original question and a set of trustworthy frames selected by the reliability-relevance score. It returns evidence in a shared format: a concrete prediction (e.g., a bounding box, motion trajectory, recognized text, or action label), temporal grounding, and a calibrated reliability score. During reasoning, these calibrated scores guide evidence weighting in a three-tier synthesis process (high/medium/low) and define a confidence-cost GRPO reward that jointly optimizes correctness, evidence reliability, and efficiency. On two video reasoning benchmarks spanning eight tasks, Robust-TO achieves 56.4% average accuracy on clean inputs, surpassing the strongest open-source baseline by 10.6%p and outperforming Gemini-2.5-Pro (46.2%). Under five realistic corruption types, Robust-TO maintains 54.3% average accuracy, 5.8%p above the strongest open-source baseline, while exhibiting the smallest clean-to-corrupted accuracy drop among all compared methods.