ChatPaper.aiChatPaper

Caracterização do Conteúdo Narrativo em Dados de Pré-treinamento de LLM em Escala Web

Characterizing Narrative Content in Web-scale LLM Pretraining Data

June 17, 2026
Autores: Teagan Johnson, Elliott Ash, Andrew Piper, Maria Antoniak
cs.AI

Resumo

A composição narrativa dos corpora de pré-treinamento de LLM em escala web permanece amplamente inexplorada, embora a narrativa seja um modo fundamental de comunicação humana. Apresentamos o primeiro estudo detalhado das características narrativas em Dolma, um corpus de pré-treinamento aberto de 3 trilhões de tokens. Com base na teoria narrativa, projetamos uma estrutura abrangendo três elementos narrativos centrais (agência, cenário e eventos) operacionalizados em 11 dimensões interpretáveis. Após amostrar e anotar um conjunto diversificado de 400 passagens, refinamos e validamos o NarraBERT, um modelo baseado em RoBERTa para predição narrativa de granularidade fina. Aplicamos o NarraBERT a 3 milhões de passagens, resultando em um novo conjunto de dados, NarraDolma. Descobrimos que (i) a estrutura narrativa é mensurável em escala em dados extremamente heterogêneos, (ii) revelamos uma estrutura narrativa contínua e multidimensional subjacente ao texto da web e (iii) as qualidades narrativas são distribuídas de forma desigual entre fontes e tópicos de pré-treinamento, de maneiras que as práticas atuais de curadoria não medem nem levam em consideração. Nossa estrutura, conjunto de dados e análises fornecem uma base para compreender como as qualidades narrativas estão distribuídas nos dados de pré-treinamento de LLM e para estudar como a composição dos dados afeta tarefas de raciocínio narrativo. Disponibilizamos publicamente o NarraDolma e o NarraBERT.
English
The narrative composition of web-scale LLM pretraining corpora remains largely unexplored even though narrative is a fundamental mode of human communication. We present the first fine-grained study of narrative features in Dolma, a 3-trillion-token open pretraining corpus. Drawing on narrative theory, we design a framework spanning three core narrative elements (agency, setting, and events) operationalized as 11 interpretable dimensions. After sampling and annotating a diverse set of 400 passages, we finetune and validate NarraBERT, a RoBERTa-based model for fine-grained narrative prediction. We apply NarraBERT to 3M passages, resulting in a new dataset, NarraDolma. We find (i) narrative structure is measurable at scale across extremely heterogeneous data, (ii) we uncover a continuous, multidimensional narrative structure underlying web text, and (iii) narrative qualities are unequally distributed across pretraining sources and topics in ways that current curation practices neither measure nor account for. Our framework, dataset, and analyses provide a foundation for understanding how narrative qualities are distributed in LLM pretraining data and for studying how data composition affects narrative reasoning tasks. We publicly release NarraDolma and NarraBERT.