ChatPaper.aiChatPaper

IntentGrasp: Um Benchmark Abrangente para Compreensão de Intenção

IntentGrasp: A Comprehensive Benchmark for Intent Understanding

May 7, 2026
Autores: Yuwei Yin, Chuyuan Li, Giuseppe Carenini
cs.AI

Resumo

Compreender com precisão a intenção por trás da fala, da conversa e da escrita é crucial para o desenvolvimento de assistentes úteis baseados em Modelos de Linguagem de Grande Escala (LLMs). Este artigo apresenta o IntentGrasp, um referencial abrangente para avaliar a capacidade de compreensão de intenção dos LLMs. Derivado de 49 corpora de alta qualidade e licença aberta, abrangendo 12 domínios diversos, o IntentGrasp é construído por meio da curadoria de conjuntos de dados fonte, contextualização dos rótulos de intenção e unificação do formato das tarefas. O IntentGrasp contém um conjunto de treinamento em larga escala com 262.759 instâncias e dois conjuntos de avaliação: um Conjunto Completo (All Set) com 12.909 casos de teste e um Conjunto Gem (Gem Set) mais equilibrado e desafiador, com 470 casos. Avaliações extensivas em 20 LLMs de 7 famílias (incluindo modelos de fronteira como GPT-5.4, Gemini-3.1-Pro e Claude-Opus-4.7) demonstram desempenho insatisfatório, com pontuações abaixo de 60% no All Set e abaixo de 25% no Gem Set. Notavelmente, 17 dos 20 modelos testados apresentaram desempenho inferior à linha de base de adivinhação aleatória (15,2%) no Gem Set, enquanto o desempenho humano estimado é de aproximadamente 81,1%, indicando uma margem substancial para melhoria. Para aprimorar essa capacidade, este artigo propõe o Ajuste Fino Intencional (IFT), que ajusta os modelos no conjunto de treinamento do IntentGrasp, resultando em ganhos significativos de mais de 30 pontos F1 no All Set e mais de 20 pontos no Gem Set. De forma significativa, os experimentos de deixar-um-domínio-fora (Lodo) demonstram ainda a forte generalização interdomínios do IFT, confirmando que esta é uma abordagem promissora para aprimorar substancialmente a compreensão de intenção dos LLMs. No geral, ao estabelecer referências e impulsionar a capacidade de compreensão de intenção, este estudo lança luz sobre um caminho promissor em direção a assistentes de IA mais intencionais, capazes e seguros para o benefício humano e o bem social.
English
Accurately understanding the intent behind speech, conversation, and writing is crucial to the development of helpful Large Language Model (LLM) assistants. This paper introduces IntentGrasp, a comprehensive benchmark for evaluating the intent understanding capability of LLMs. Derived from 49 high-quality, open-licensed corpora spanning 12 diverse domains, IntentGrasp is constructed through source datasets curation, intent label contextualization, and task format unification. IntentGrasp contains a large-scale training set of 262,759 instances and two evaluation sets: an All Set of 12,909 test cases and a more balanced and challenging Gem Set of 470 cases. Extensive evaluations on 20 LLMs across 7 families (including frontier models such as GPT-5.4, Gemini-3.1-Pro, and Claude-Opus-4.7) demonstrate unsatisfactory performance, with scores below 60% on All Set and below 25% on Gem set. Notably, 17 out of 20 tested models perform worse than a random-guess baseline (15.2%) on Gem Set, while the estimated human performance is ~81.1%, showing substantial room for improvement. To enhance such ability, this paper proposes Intentional Fine-Tuning (IFT), which fine-tunes the models on the training set in IntentGrasp, yielding significant gains of 30+ F1 points on All Set and 20+ points on Gem Set. Tellingly, the leave-one-domain-out (Lodo) experiments further demonstrate the strong cross-domain generalizability of IFT, verifying that it is a promising approach to substantially enhancing the intent understanding of LLMs. Overall, by benchmarking and boosting intent understanding ability, this study sheds light on a promising path towards more intentional, capable, and safe AI assistants for human benefits and social good.