AGORA : un benchmark ancré sur des archives pour le raisonnement agentique sur des documents en milieu professionnel
AGORA: An Archive-Grounded Benchmark for Agentic Workplace Document Reasoning
June 23, 2026
Auteurs: Honglin Guo, Qi Zhang, Yu Zhang, Weijie Li, Rui Zheng, Zhikai Lei, Qiyuan Peng, Zhiheng Xi, Tao Gui, Qi Zhang
cs.AI
Résumé
Les modèles de langage de grande taille sont de plus en plus déployés en tant qu'agents qui raisonnent sur des documents plutôt que de répondre à partir de connaissances paramétriques. Nous étudions le raisonnement fondé sur des archives : localiser des preuves éparses dans une vaste collection désordonnée de fichiers professionnels, concilier des terminologies, unités et conventions temporelles incohérentes, et calculer une réponse. Les référentiels existants ne couvrent que des parties de ce contexte et aucun ne met simultanément l'accent sur la fondation sur archives, l'exploration agentique et la couverture inter-domaines. Nous présentons Agora, un référentiel associant 362 questions à huit collections thématiques de 9 664 documents authentiques et 372 millions de tokens, dépassant largement la fenêtre de contexte de tout modèle, de sorte que les agents doivent explorer délibérément plutôt que parcourir exhaustivement. Agora est construit par un pipeline agentique combinant une synthèse de tâches inter-documents, une obfuscation empêchant les fuites et un filtrage de difficulté. En évaluant huit modèles, nous constatons que la tâche est loin d'être résolue : même le plus performant n'atteint que 59,4 % de précision, avec des variations notables selon les domaines.
English
Large language models are increasingly deployed as agents that reason over documents rather than answer from parametric knowledge. We study archive-grounded reasoning: locating sparse evidence across a large, messy collection of workplace files, reconciling inconsistent terminology, units, and time conventions, and computing an answer. Existing benchmarks address only parts of this setting and none jointly stresses archive-groundedness, agentic exploration, and cross-domain coverage. We introduce Agora, a benchmark pairing 362 questions with eight domain collections of 9,664 authentic documents and 372M tokens, far exceeding any model's context window, so agents must explore deliberately rather than scan exhaustively. Agora is built by an agentic pipeline combining cross-document task synthesis, leakage-preventing obfuscation, and difficulty filtering. Evaluating eight models, we find the task far from solved: even the strongest reaches only 59.4% accuracy, with notable variation across domains.