ChatPaper.aiChatPaper

AGORA: Um Benchmark Fundamentado em Arquivos para Raciocínio de Documentos em Ambiente de Trabalho com Agentes

AGORA: An Archive-Grounded Benchmark for Agentic Workplace Document Reasoning

June 23, 2026
Autores: Honglin Guo, Qi Zhang, Yu Zhang, Weijie Li, Rui Zheng, Zhikai Lei, Qiyuan Peng, Zhiheng Xi, Tao Gui, Qi Zhang
cs.AI

Resumo

Grandes modelos de linguagem são cada vez mais implantados como agentes que raciocinam sobre documentos, em vez de responderem a partir de conhecimento paramétrico. Estudamos o raciocínio fundamentado em arquivos: localizar evidências esparsas em uma grande e desordenada coleção de arquivos de ambiente de trabalho, conciliando terminologia, unidades e convenções de tempo inconsistentes, e calculando uma resposta. Os benchmarks existentes abordam apenas partes desse cenário e nenhum enfatiza conjuntamente a fundamentação em arquivos, a exploração agentiva e a cobertura entre domínios. Apresentamos o Agora, um benchmark que combina 362 perguntas com oito coleções de domínio de 9.664 documentos autênticos e 372 milhões de tokens, excedendo em muito a janela de contexto de qualquer modelo, de modo que os agentes devem explorar deliberadamente em vez de examinar exaustivamente. O Agora é construído por um pipeline agentivo que combina síntese de tarefas entre documentos, ofuscação para prevenir vazamento e filtragem de dificuldade. Avaliando oito modelos, constatamos que a tarefa está longe de ser resolvida: mesmo o mais forte atinge apenas 59,4% de precisão, com variação notável entre os domínios.
English
Large language models are increasingly deployed as agents that reason over documents rather than answer from parametric knowledge. We study archive-grounded reasoning: locating sparse evidence across a large, messy collection of workplace files, reconciling inconsistent terminology, units, and time conventions, and computing an answer. Existing benchmarks address only parts of this setting and none jointly stresses archive-groundedness, agentic exploration, and cross-domain coverage. We introduce Agora, a benchmark pairing 362 questions with eight domain collections of 9,664 authentic documents and 372M tokens, far exceeding any model's context window, so agents must explore deliberately rather than scan exhaustively. Agora is built by an agentic pipeline combining cross-document task synthesis, leakage-preventing obfuscation, and difficulty filtering. Evaluating eight models, we find the task far from solved: even the strongest reaches only 59.4% accuracy, with notable variation across domains.