ChatPaper.aiChatPaper

Het aanleren van een laag-resource taal aan grote taalmodellen: Verbetering van code-aanvulling in Pharo

Teaching LLMs a Low-Resource Language: Enhancing Code Completion in Pharo

July 6, 2026
Auteurs: Kilian Kier, Alessandro Giagnorio, Omar AbedelKader, Oleksandr Zaitsev, Robert Peharz, Romain Robbes, Gabriele Bavota, Stéphane Ducasse
cs.AI

Samenvatting

Large Language Models (LLM's) hebben nieuwe mogelijkheden geopend in geautomatiseerd code schrijven en zijn de ruggengraat geworden van de meeste code-aanvullingstools. Hoewel LLM's uitblinken in mainstream talen, bieden ze vaak geen ondersteuning voor de zogenaamde laag-resource talen waar trainingsdata schaars is. Als gevolg hiervan blijven deze talen achter in de kwaliteit van code-aanvullingstools die beschikbaar zijn voor hun gemeenschappen. Een concreet voorbeeld is Pharo, een door Smalltalk geïnspireerde taal waarvan de IDE momenteel alleen enkele-token aanvulling biedt. In dit werk rapporteren we over onze ervaring met het brengen van LLM-gebaseerde code-aanvulling naar Pharo. Ten eerste beschrijven we een end-to-end pipeline die Pharo-specifieke data curatie combineert met voortgezette pre-training en fine-tuning van open code LLM's. Ten tweede introduceren we een reeks Pharo code-aanvullingsbenchmarks die zijn ontworpen om te evalueren of modellen (i) de syntax van Pharo leren en (ii) nauwkeurig gemaskeerde Pharo-code uit echte GitHub-repositories aanvullen. Ten derde tonen we empirisch aan dat Pharo-gespecialiseerde modellen aanzienlijk beter presteren dan hun oorspronkelijke basis-checkpoints en ook de nauwkeurigheid van aanzienlijk grotere code-LLM's overtreffen bij Pharo-aanvulling. Over het algemeen toont onze casestudy de haalbaarheid aan van het brengen van sterke LLM-gebaseerde code-aanvulling naar laag-resource programmeertalen, met modellen die klein genoeg zijn om 'real-time' ondersteuning in de IDE te bieden.
English
Large Language Models (LLMs) unlocked new possibilities in automated code writing, becoming the backbone of most code completion tools. While LLMs excel in mainstream languages, they often lack support for the so-called low-resource languages where training data is scarce. As a result, these languages lag behind in the quality of code completion tooling available to their communities. A concrete example is Pharo, a Smalltalk-inspired language whose IDE currently offers only single-token completion. In this work, we report on our experience bringing LLM-based code completion to Pharo. First, we describe an end-to-end pipeline that combines Pharo-specific data curation, continued pre-training and fine-tuning of open code LLMs. Second, we introduce a set of Pharo code completion benchmarks designed to evaluate whether models (i) learn Pharo's syntax and (ii) accurately complete masked Pharo code from real-world GitHub repositories. Third, we show empirically that Pharo-specialized models substantially outperform their original base checkpoints and also exceed the accuracy of substantially larger code LLMs on Pharo completion. Overall, our case study demonstrates the feasibility of bringing strong LLM-based code completion to low-resource programming languages, with models small enough to provide ``real-time'' in-IDE support.