Repetição sobre Diversidade: Filtragem de Dados de Alto Sinal para Modelagem de Língua Alemã com Eficiência Amostral
Repetition over Diversity: High-Signal Data Filtering for Sample-Efficient German Language Modeling
April 30, 2026
Autores: Ansar Aynetdinov, Patrick Haller, Alan Akbik
cs.AI
Resumo
Pesquisas recentes demonstraram que filtrar corpora massivos da web em inglês para obter subconjuntos de alta qualidade melhora significativamente a eficiência do treinamento. No entanto, para línguas não inglesas de alto recurso, como alemão, francês ou japonês, a filtragem agressiva cria um dilema estratégico: os profissionais devem priorizar a diversidade treinando uma única vez com grandes volumes de dados da web levemente filtrados, ou devem priorizar a qualidade filtrando rigorosamente um núcleo de alta qualidade e repetindo-o ao longo de múltiplas épocas? Investigamos este compromisso (trade-off) para o alemão construindo filtros hierárquicos de qualidade aplicados a 500 milhões de documentos da web, comparando o treinamento multiépoca nos subconjuntos filtrados com o treinamento de passagem única em um corpus diversificado. Nossos experimentos em múltiplas escalas de modelo e orçamentos de tokens mostram que a repetição de dados de alta qualidade supera consistentemente o treinamento de passagem única em conjuntos maiores e menos filtrados. Notavelmente, a diferença de desempenho persiste mesmo após 7 épocas. Nossas descobertas sugerem que, para LLMs não ingleses, a concentração semântica por meio da filtragem de qualidade oferece um caminho mais viável para uma modelagem de linguagem eficiente do que simplesmente maximizar o volume de dados únicos. Disponibilizamos nossos modelos de linguagem alemães (chamados Boldt), bem como nossos benchmarks de avaliação limpos, para a comunidade de pesquisa. Nossos experimentos indicam que eles alcançam resultados de última geração (state-of-the-art) apesar de serem treinados com 10 a 360 vezes menos tokens do que modelos comparáveis.
English
Recent research has shown that filtering massive English web corpora into high-quality subsets significantly improves training efficiency. However, for high-resource non-English languages like German, French, or Japanese, aggressive filtering creates a strategic dilemma: should practitioners prioritize diversity by training once on large amounts of lightly filtered web data, or prioritize quality by strictly filtering for a high-quality core and repeating it over multiple epochs? We investigate this trade-off for German by constructing hierarchical quality filters applied to 500M web documents, comparing multi-epoch training on the filtered subsets against single-pass training on a diverse corpus. Our experiments across multiple model scales and token budgets show that repeating high-quality data consistently outperforms single-pass training on larger, less filtered sets. Notably, the performance gap persists even after 7 epochs. Our findings suggest that for non-English LLMs, semantic concentration through quality filtering offers a more viable path to efficient language modeling than simply maximizing unique data volume. We release our German language models (called Boldt), as well as our cleaned evaluation benchmarks to the research community. Our experiments indicate that they achieve state-of-the-art results despite training on 10-360x fewer tokens than comparable models.