MultAttnAttrib: Atribuição Multimodal Sem Treinamento em Resposta a Perguntas em Documentos Longos
MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering
July 1, 2026
Autores: Dang Quang Thien Tran, Quang V. Dang, Vinamra Tyagi, Sai Soorya Rao Veeravalli, Trang Nguyen, Ryan A. Rossi, Franck Dernoncourt, Nedim Lipka, Koustava Goswami, Samyadeep Basu
cs.AI
Resumo
À medida que sistemas de QA fundamentados são cada vez mais implantados em assistentes de IA, atribuir com precisão respostas geradas a evidências é fundamental para a confiança do usuário e a segurança do modelo. Embora atribuições unimodais tenham sido exploradas em profundidade, o cenário multimodal permanece relativamente pouco estudado. Como resultado, apresentamos o MultAttnAttrib, um método de geração de atribuição livre de treinamento que aproveita o passo de pré-preenchimento do modelo, cabeças de atenção selecionadas e limiares calibrados para localizar evidências de origem dentro de um documento. Para estabelecer resultados de referência para o método, introduzimos o MultAttrEval, um conjunto de dados de referência complementar anotado com atribuições de verdade fundamental em nível fino para componentes de resposta fundamentados em documentos-fonte multimodais. Até onde sabemos, este é o primeiro conjunto de dados de avaliação projetado especificamente para atribuição multimodal em documentos longos. Resultados experimentais mostram que o MultAttnAttrib supera consistentemente uma variedade de métodos de geração de atribuição, incluindo várias abordagens robustas baseadas em prompts, e equipara-se a modelos de fronteira recentes, como o GPT 5.4. Nosso método não apenas melhora substancialmente a acurácia da atribuição tanto para tipos de atribuição unimodal quanto multimodal, mas também produz atribuições com até um sétimo da latência de inferência direta em comparação com o uso de prompts no mesmo modelo base.
English
As grounded QA systems are increasingly deployed in AI assistants, accurately attributing generated answers to evidence is critical for user trust and model safety. While unimodal attributions have been explored in depth, the multimodal setting remains relatively under-researched. As a result, we introduce MultAttnAttrib, a training-free attribution-generation method that leverages a model's prefill pass, selected attention heads, and calibrated thresholds to locate source evidence within a document. To establish baseline results for the method, we introduce MultAttrEval, a complementary benchmark dataset annotated with fine-grained, ground-truth attributions for answer components grounded in multimodal source documents. To our knowledge, this is the first evaluation dataset designed specifically for multimodal attribution in long-form documents. Experimental results show that MultAttnAttrib consistently outperforms a variety of attribution-generation methods, including several strong prompting-based approaches and matches the latest frontier models such as GPT 5.4. Our method not only substantially improves attribution accuracy for both unimodal and multimodal attribution types, but also produces attributions at up to one-seventh of the direct inference latency compared to prompting on the same base model.