ChatPaper.aiChatPaper

LLiMba : le sarde sur un seul GPU — Adapter un modèle de langage de 3 milliards de paramètres à une langue romane en voie de disparition

LLiMba: Sardinian on a Single GPU -- Adapting a 3B Language Model to a Vanishing Romance Language

May 9, 2026
Auteurs: Luca Ballore
cs.AI

Résumé

Le sarde, une langue romane comptant environ un million de locuteurs, est quasi absent du traitement automatique des langues moderne. Les services commerciaux ne le prennent pas en charge et les modèles de langue actuels ne le produisent pas de manière fiable. Nous présentons LLiMba, un modèle de 3 milliards de paramètres adapté au sarde à partir de Qwen2.5-3B-Instruct via un pré-entraînement continu (CPT) et un ajustement fin supervisé (SFT) sur un seul GPU grand public de 24 Go. Le corpus contient 11,5 millions de tokens de sarde couvrant le LSC, le logoudorien et le campidanien, augmentés de 2,4 millions de tokens de textes romans apparentés en tant que rejeu contre le flou des registres. Après le CPT, le modèle atteint une perplexité de 6,76 sur le sarde mis de côté et surpasse le modèle de base dans l'ensemble des six directions FLORES-200. Nous comparons cinq configurations SFT dans des conditions appariées : ajustement fin complet, LoRA r64, rsLoRA r128, rsLoRA r256 et DoRA r256. rsLoRA r256 l'emporte sur toutes les directions vers le sarde, atteignant 28,5 BLEU depuis l'anglais contre 17,3 après CPT et 21,0 avec un ajustement fin complet. L'ablation par rang place r128 entre LoRA r64 et rsLoRA r256 en termes de BLEU, mais révèle des modes d'échec invisibles à la métrique, notamment une contamination entre scripts qu'aucune autre variante ne produit. LoRA r64 retient moins de contenu factuel du SFT que les configurations de rang supérieur et produit des fabrications plus confiantes, bien que toutes les méthodes fabriquent du contenu absent de l'entraînement. DoRA r256 donne l'écart le plus faible entre entraînement et évaluation, mais la pire précision factuelle. Les résultats indiquent que la capacité de l'adaptateur importe plus que le choix parmi les variantes LoRA pour adapter une base pré-entraînée romane à une cible romane peu dotée, qu'une régularisation plus forte n'est pas uniformément bénéfique, et que les métriques de traduction ordonnent en douceur des configurations dont le comportement qualitatif diffère catégoriquement. Les comparaisons de perplexité entre scripts doivent tenir compte de la tokenisation par repli d'octet, qui réduit la métrique pour les scripts autres que latin.
English
Sardinian, a Romance language with roughly one million speakers, has minimal presence in modern NLP. Commercial services do not support it, and current language models do not produce it reliably. We present LLiMba, a 3B parameter Sardinian-ready model adapted from Qwen2.5-3B-Instruct through continued pretraining (CPT) and supervised fine-tuning (SFT) on a single 24 GB consumer GPU. The corpus contains 11.5 million tokens of Sardinian spanning LSC, Logudorese, and Campidanese, augmented with 2.4 million tokens of related Romance text as replay against register blurring. After CPT the model reaches a perplexity of 6.76 on held out Sardinian and outperforms the base across all six FLORES-200 directions. We compare five SFT configurations under matched conditions: full fine-tuning, LoRA r64, rsLoRA r128, rsLoRA r256, and DoRA r256. rsLoRA r256 wins on every direction into Sardinian, reaching 28.5 BLEU from English against 17.3 after CPT and 21.0 with full fine-tuning. The rank ablation places r128 between LoRA r64 and rsLoRA r256 on BLEU but reveals failure modes invisible to the metric, including leakage across scripts no other variant produces. LoRA r64 retains less factual content from SFT than configurations at higher rank and produces more confident fabrications, though all methods fabricate on content absent from training. DoRA r256 yields the smallest gap between training and evaluation but the worst factual accuracy. The findings indicate that adapter capacity matters more than the choice among LoRA variants for adapting a Romance pretrained base to a low resource Romance target, that stronger regularization is not uniformly beneficial, and that translation metrics smoothly order configurations whose qualitative behavior differs categorically. Perplexity comparisons across scripts must account for byte fallback tokenization, which deflates the metric for scripts other than Latin.