ClawMark : Un benchmark du monde vivant pour les agents collaborateurs multimodaux multi-tours et multi-jours
ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents
April 26, 2026
Auteurs: Fanqing Meng, Lingxiao Du, Zijian Wu, Guanzheng Chen, Xiangyan Liu, Jiaqi Liao, Chonghe Jiang, Zhenglin Wan, Jiawei Gu, Pengfei Zhou, Rui Huang, Ziqi Zhao, Shengyuan Ding, Ailing Yu, Bo Peng, Bowei Xia, Hao Sun, Haotian Liang, Ji Xie, Jiajun Chen, Jiajun Song, Liu Yang, Ming Xu, Qionglin Qiu, Runhao Fu, Shengfang Zhai, Shijian Wang, Tengfei Ma, Tianyi Wu, Weiyang Jin, Yan Wang, Yang Dai, Yao Lai, Youwei Shu, Yue Liu, Yunzhuo Hao, Yuwei Niu, Jinkai Huang, Jiayuan Zhuo, Zhennan Shen, Linyu Wu, Cihang Xie, Yuyin Zhou, Jiaheng Zhang, Zeyu Zheng, Mengkang Hu, Michael Qizhe Shieh
cs.AI
Résumé
Les agents basés sur modèles de langage sont de plus en plus utilisés comme collaborateurs permanents assistant les utilisateurs sur plusieurs jours de travail. Au cours de tels flux de travail, l'environnement peut évoluer indépendamment de l'agent : de nouveaux e-mails arrivent, les entrées de calendrier changent, les enregistrements des bases de connaissances sont mis à jour, et des preuves apparaissent dans des images, des PDF scannés, des fichiers audio, vidéo et des feuilles de calcul. Les benchmarks existants n'évaluent pas adéquatement ce contexte car ils s'exécutent généralement dans un épisode statique unique et restent largement centrés sur le texte. Nous présentons , un benchmark pour les agents collaborateurs construit autour de tâches multi-tours et multi-jours, d'un environnement de services sandboxé avec état dont l'état évolue entre les tours, et d'une vérification basée sur des règles. La version actuelle contient 100 tâches couvrant 13 scénarios professionnels, exécutées contre cinq services sandboxés avec état (système de fichiers, e-mail, calendrier, base de connaissances, tableur) et notées par 1537 vérificateurs Python déterministes sur l'état des services après exécution ; aucun LLM-comme-juge n'est invoqué pendant la notation. Nous évaluons sept systèmes d'agents de pointe. Le modèle le plus performant atteint un score pondéré de 75,8 %, mais le meilleur taux de Réussite Stricte des Tâches n'est que de 20,0 %, indiquant que les progrès partiels sont courants tandis que l'exécution complète de bout en bout des flux de travail reste rare. L'analyse au niveau du tour montre que les performances chutent après la première mise à jour exogène de l'environnement, soulignant que l'adaptation à un état changeant est un défi ouvert clé. Nous publions le benchmark, son harness d'évaluation et son pipeline de construction pour soutenir une évaluation reproductible des agents collaborateurs.
English
Language-model agents are increasingly used as persistent coworkers that assist users across multiple working days. During such workflows, the surrounding environment may change independently of the agent: new emails arrive, calendar entries shift, knowledge-base records are updated, and evidence appears across images, scanned PDFs, audio, video, and spreadsheets. Existing benchmarks do not adequately evaluate this setting because they typically run within a single static episode and remain largely text-centric. We introduce , a benchmark for coworker agents built around multi-turn multi-day tasks, a stateful sandboxed service environment whose state evolves between turns, and rule-based verification. The current release contains 100 tasks across 13 professional scenarios, executed against five stateful sandboxed services (filesystem, email, calendar, knowledge base, spreadsheet) and scored by 1537 deterministic Python checkers over post-execution service state; no LLM-as-judge is invoked during scoring. We benchmark seven frontier agent systems. The strongest model reaches 75.8 weighted score, but the best strict Task Success is only 20.0\%, indicating that partial progress is common while complete end-to-end workflow completion remains rare. Turn-level analysis shows that performance drops after the first exogenous environment update, highlighting adaptation to changing state as a key open challenge. We release the benchmark, evaluation harness, and construction pipeline to support reproducible coworker-agent evaluation.