ChatPaper.aiChatPaper

KletterMix : Grimper vers des données de pré-entraînement allemandes de haute qualité

KletterMix: Climbing Toward High-Quality German Pretraining Data

June 2, 2026
Auteurs: Maurice Kraus, Ruben Härle, Sebastian Sztwiertnia, Abbas Goher Khan, Mehdi Ali, Michael Fromm, Kristian Kersting
cs.AI

Résumé

Les données de pré-entraînement de haute qualité constituent un ingrédient central des modèles de langage modernes, mais les ressources en langue allemande restent bien moins développées que leurs équivalentes anglaises : elles sont souvent plus petites, moins soigneusement organisées, faiblement documentées et rarement validées par des expériences d'entraînement contrôlées. Nous présentons KletterMix, un corpus allemand de haute qualité pour le pré-entraînement et le recuit de modèles de langage, conçu comme un artefact de données réutilisable pour la communauté du traitement automatique des langues et de la modélisation. KletterMix est construit en traduisant un corpus de pré-entraînement anglais de pointe en allemand, tout en préservant les limites des documents, les métadonnées, la structure des sources et la diversité thématique. Cette construction produit un corpus allemand possédant l'échelle et la diversité d'un ensemble de données de pré-entraînement moderne, tout en permettant une comparaison directe avec sa source anglaise. Nous documentons l'ensemble de données par le biais d'un large éventail d'analyses au niveau du corpus, notamment la qualité de la traduction, les distributions de longueur des documents, la couverture thématique, la composition des sources et les métadonnées géographiques. À l'aide de COMETKiwi, nous montrons que les documents traduits atteignent une qualité élevée dans des domaines divers, ce qui suggère qu'une traduction minutieuse peut préserver une grande partie de la richesse sémantique et stylistique du corpus d'origine. Au-delà de la construction de l'ensemble de données, nous évaluons KletterMix en tant que données d'entraînement. Grâce à des ablations contrôlées de pré-entraînement et de recuit par rapport à des corpus allemands établis, nous montrons que les modèles entraînés sur KletterMix obtiennent des améliorations mesurables dans les évaluations en aval en langue allemande. Ces résultats démontrent que des données traduites soigneusement organisées peuvent considérablement renforcer l'écosystème de données de pré-entraînement en allemand.
English
High-quality pretraining data is a central ingredient in modern language models, but German-language resources remain far less developed than their English counterparts: they are often smaller, less carefully curated, weakly documented, and rarely validated through controlled training experiments. We introduce KletterMix, a high-quality German corpus for language model pretraining and annealing, designed as a reusable dataset artifact for the natural language processing and modeling community. KletterMix is built by translating a state-of-the-art English pretraining corpus into German while preserving document boundaries, metadata, source structure, and topical diversity. This construction yields a German corpus with the scale and diversity of a modern pretraining dataset, while enabling direct comparison to its English source. We document the dataset through a broad set of corpus-level analyses, including translation quality, document length distributions, topic coverage, source composition, and geographic metadata. Using COMETKiwi, we show that the translated documents achieve strong quality across diverse domains, suggesting that careful translation can preserve much of the semantic and stylistic richness of the original corpus. Beyond dataset construction, we evaluate KletterMix as training data. Through controlled pretraining and annealing ablations against established German corpora, we show that models trained on KletterMix achieve measurable improvements on German-language downstream evaluations. These results demonstrate that carefully curated translated data can substantially strengthen the German pretraining data ecosystem.