CreativityBench: Avaliação do Raciocínio Criativo de Agentes por meio da Repropósito de Ferramentas Baseado em Afordâncias
CreativityBench: Evaluating Agent Creative Reasoning via Affordance-Based Tool Repurposing
May 6, 2026
Autores: Cheng Qian, Hyeonjeong Ha, Jiayu Liu, Jeonghwan Kim, Jiateng Liu, Bingxuan Li, Aditi Tiwari, Dwip Dalal, Zhenhailong Wang, Xiusi Chen, Mahdi Namazifar, Yunzhu Li, Heng Ji
cs.AI
Resumo
Os recentes avanços em grandes modelos de linguagem têm levado a um forte desempenho em tarefas de raciocínio e interação com o ambiente, mas a sua capacidade para a resolução criativa de problemas permanece pouco explorada. Estudamos esta capacidade através da lente do uso criativo de ferramentas, em que um modelo reaproveita objetos disponíveis, raciocinando sobre as suas possibilidades de ação (affordances) e atributos, em vez de depender do uso canónico. Como primeiro passo, apresentamos a CreativityBench, uma referência para avaliar a criatividade baseada em affordances em LLMs. Para tal, construímos uma base de conhecimento (KB) de larga escala sobre affordances, com 4 mil entidades e mais de 150 mil anotações, ligando explicitamente objetos, partes, atributos e utilizações acionáveis. Com base nesta KB, geramos 14 mil tarefas fundamentadas que exigem a identificação de soluções não óbvias, mas fisicamente plausíveis, sob restrições. As avaliações em 10 LLMs de última geração, incluindo modelos proprietários e de código aberto, mostram que os modelos conseguem frequentemente selecionar um objeto plausível, mas falham em identificar as partes corretas, as suas affordances e o mecanismo físico subjacente necessário para resolver a tarefa, levando a uma queda significativa no desempenho. Além disso, as melhorias provenientes do aumento da escala do modelo saturam rapidamente, um raciocínio geral forte não se traduz de forma fiável na descoberta criativa de affordances, e estratégias comuns no momento da inferência, como a Cadeia de Pensamento (Chain-of-Thought), produzem ganhos limitados. Estes resultados sugerem que o uso criativo de ferramentas permanece um grande desafio para os modelos atuais, e que a CreativityBench fornece um campo de teste útil para estudar esta dimensão em falta da inteligência, com potenciais implicações para módulos de planeamento e raciocínio em agentes futuros.
English
Recent advances in large language models have led to strong performance on reasoning and environment-interaction tasks, yet their ability for creative problem-solving remains underexplored. We study this capability through the lens of creative tool use, where a model repurposes available objects by reasoning about their affordances and attributes rather than relying on canonical usage. As a first step, we introduce CreativityBench, a benchmark for evaluating affordance-based creativity in LLMs. To this end, we build a large-scale affordance knowledge base (KB) with 4K entities and 150K+ affordance annotations, explicitly linking objects, parts, attributes, and actionable uses. Building on this KB, we generate 14K grounded tasks that require identifying non-obvious yet physically plausible solutions under constraints. Evaluations across 10 state-of-the-art LLMs, including closed and open-source models, show that models can often select a plausible object, but fail to identify the correct parts, their affordances, and the underlying physical mechanism needed to solve the task, leading to a significant drop in performance. Furthermore, improvements from model scaling quickly saturate, strong general reasoning does not reliably translate to creative affordance discovery, and common inference-time strategies such as Chain-of-Thought yield limited gains. These results suggest that creative tool use remains a major challenge for current models, and that CreativityBench provides a useful testbed for studying this missing dimension of intelligence, with potential implications for planning and reasoning modules in future agents.