LLiMba: Sardisch op een enkele GPU – het aanpassen van een 3B-taalmodel aan een verdwijnende Romaanse taal
LLiMba: Sardinian on a Single GPU -- Adapting a 3B Language Model to a Vanishing Romance Language
May 9, 2026
Auteurs: Luca Ballore
cs.AI
Samenvatting
Het Sardisch, een Romaanse taal met ongeveer een miljoen sprekers, heeft een minimale aanwezigheid in moderne NLP. Commerciële diensten ondersteunen het niet, en huidige taalmodellen genereren het niet betrouwbaar. Wij presenteren LLiMba, een 3B parameter Sardisch-gereed model dat is aangepast van Qwen2.5-3B-Instruct door middel van voortgezette pretraining (CPT) en supervised fine-tuning (SFT) op een enkele 24 GB consumenten-GPU. Het corpus bevat 11,5 miljoen tokens Sardisch, verspreid over LSC, Logudorees en Campidanees, aangevuld met 2,4 miljoen tokens van verwante Romaanse tekst als replay tegen registervervaging. Na CPT bereikt het model een perplexiteit van 6,76 op vastgehouden Sardisch en presteert het beter dan de basis in alle zes FLORES-200-richtingen. Wij vergelijken vijf SFT-configuraties onder gelijkwaardige omstandigheden: volledige fine-tuning, LoRA r64, rsLoRA r128, rsLoRA r256 en DoRA r256. rsLoRA r256 wint in elke richting naar het Sardisch, met 28,5 BLEU vanuit het Engels tegen 17,3 na CPT en 21,0 met volledige fine-tuning. De rank-ablatie plaatst r128 tussen LoRA r64 en rsLoRA r256 op BLEU, maar onthult faalwijzen die onzichtbaar zijn voor de metriek, waaronder lekkage over schriften die geen andere variant produceert. LoRA r64 behoudt minder feitelijke inhoud uit SFT dan configuraties met een hogere rank en produceert meer zelfverzekerde fabricages, hoewel alle methoden fabriceren over inhoud die ontbreekt in de training. DoRA r256 levert de kleinste kloof tussen training en evaluatie, maar de slechtste feitelijke nauwkeurigheid. De bevindingen geven aan dat adaptercapaciteit belangrijker is dan de keuze tussen LoRA-varianten voor het aanpassen van een Romaanse voorgestructureerde basis aan een Romaans doeldomein met weinig bronnen, dat sterkere regularisatie niet uniform gunstig is, en dat vertaalmetrieken configuraties soepel ordenen waarvan het kwalitatieve gedrag categorisch verschilt. Perplexiteitsvergelijkingen tussen schriften moeten rekening houden met byte-fallback-tokenisatie, die de metriek verlaagt voor andere schriften dan het Latijnse.
English
Sardinian, a Romance language with roughly one million speakers, has minimal presence in modern NLP. Commercial services do not support it, and current language models do not produce it reliably. We present LLiMba, a 3B parameter Sardinian-ready model adapted from Qwen2.5-3B-Instruct through continued pretraining (CPT) and supervised fine-tuning (SFT) on a single 24 GB consumer GPU. The corpus contains 11.5 million tokens of Sardinian spanning LSC, Logudorese, and Campidanese, augmented with 2.4 million tokens of related Romance text as replay against register blurring. After CPT the model reaches a perplexity of 6.76 on held out Sardinian and outperforms the base across all six FLORES-200 directions. We compare five SFT configurations under matched conditions: full fine-tuning, LoRA r64, rsLoRA r128, rsLoRA r256, and DoRA r256. rsLoRA r256 wins on every direction into Sardinian, reaching 28.5 BLEU from English against 17.3 after CPT and 21.0 with full fine-tuning. The rank ablation places r128 between LoRA r64 and rsLoRA r256 on BLEU but reveals failure modes invisible to the metric, including leakage across scripts no other variant produces. LoRA r64 retains less factual content from SFT than configurations at higher rank and produces more confident fabrications, though all methods fabricate on content absent from training. DoRA r256 yields the smallest gap between training and evaluation but the worst factual accuracy. The findings indicate that adapter capacity matters more than the choice among LoRA variants for adapting a Romance pretrained base to a low resource Romance target, that stronger regularization is not uniformly beneficial, and that translation metrics smoothly order configurations whose qualitative behavior differs categorically. Perplexity comparisons across scripts must account for byte fallback tokenization, which deflates the metric for scripts other than Latin.