CoffeeBench: Benchmarking de Agentes LLM de Longo Horizonte em Economias Multiagente Heterogêneas
CoffeeBench: Benchmarking Long-Horizon LLM Agents in Heterogeneous Multi-Agent Economies
June 15, 2026
Autores: Issa Sugiura, Daichi Hattori, Kazuo Araragi, Keita Ogawa, Shota Onose, Taro Makino, Teppei Usuki, Takashi Ishida
cs.AI
Resumo
À medida que os agentes baseados em LLMs se tornam capazes de realizar tarefas com horizontes de tempo cada vez mais longos, a avaliação de seu desempenho em sistemas econômicos torna-se cada vez mais importante. Diferentemente dos benchmarks existentes, que avaliam principalmente um único agente interagindo com um ambiente passivo, os sistemas econômicos são inerentemente multiagentes, exigindo que agentes autônomos se comuniquem, negociem e realizem transações enquanto perseguem seus próprios objetivos por longos períodos. Apresentamos o CoffeeBench, um benchmark para avaliação de agentes LLM em uma economia multiagente de longo horizonte composta por firmas heterogêneas. No CoffeeBench, dois agricultores, dois torrefadores e dois varejistas operam seus negócios de forma autônoma em uma simulação de 90 dias, cada um buscando maximizar a renda líquida acumulada por meio de comunicação e transações, enquanto gerenciam caixa, estoque e preços. O modelo avaliado controla um torrefador de café, enquanto as demais firmas são controladas por agentes de referência fixos. Dentre vários LLMs recentes de código aberto e proprietários, todos os modelos superam uma linha de base passiva que não realiza ações, com a maioria obtendo renda líquida positiva. A análise do comportamento dos agentes revela diferenças substanciais na interação econômica de longo horizonte: modelos de melhor desempenho se comunicam mais ativamente com outras firmas, enquanto o Claude Haiku 4.5 exibe um modo de falha de deriva ociosa, repetidamente optando pela inação apesar de produzir avaliações e planos coerentes. Disponibilizamos nosso código e as trajetórias dos agentes para apoiar pesquisas futuras.
English
As LLM agents become capable of increasingly long-horizon tasks, evaluating their performance in economic systems is becoming increasingly important. Unlike existing benchmarks that primarily evaluate a single agent interacting with a passive environment, economic systems are inherently multi-agent, requiring autonomous agents to communicate, negotiate, and transact while pursuing their own objectives over extended periods. We introduce CoffeeBench, a benchmark for evaluating LLM agents in a long-horizon multi-agent economy composed of heterogeneous firms. In CoffeeBench, two farmers, two roasters, and two retailers autonomously operate their businesses over a 90-day simulation, each seeking to maximize cumulative net income through communication and transactions while managing cash, inventory, and pricing. The evaluated model controls one coffee roaster, while the remaining firms are controlled by fixed reference agents. Across several recent open-weight and proprietary LLMs, all models outperform a passive baseline that takes no actions, with most achieving positive net income. Analysis of agent behavior reveals substantial differences in long-horizon economic interaction: higher-performing models communicate more actively with other firms, whereas Claude~Haiku~4.5 exhibits an idle-drift failure mode, repeatedly choosing inaction despite producing coherent assessments and plans. We release our code and agent trajectories to support future research.