ChatPaper.aiChatPaper

Kunnen dialecten net zo worden gestuurd als talen? Schaarse neuronen en gedistribueerde richtingen in Arabische LLM's

Can Dialects Be Steered Like Languages? Sparse Neurons and Distributed Directions in Arabic LLMs

July 4, 2026
Auteurs: Kareem Elozeiri, Mervat Abassy, Omar Kallas, Fahim Dalvi, Preslav Nakov, Kentaro Inui, Nadir Durrani
cs.AI

Samenvatting

Een belangrijke uitdaging in de Arabische NLP is de schaarste aan dialectdata in vergelijking met Modern Standaard Arabisch (MSA), waardoor LLM’s overmatig MSA produceren en moeite hebben met dialectisch accurate generatie. Vanuit een interpreteerbaarheidsperspectief roept dit een fundamentele vraag op: waar en hoe worden dialectische kenmerken gecodeerd binnen de interne structuur van het model, en kunnen deze representaties worden benut om dialectgeneratie te verbeteren zonder fijnafstemming? Deze studie onderzoekt twee complementaire inferentietijdbenaderingen die tegelijkertijd dienen als interpreteerbaarheidsprobes en controleinstrumenten. Ten eerste voeren we een analyse op neuronniveau uit, waarbij we schaarse neuronpopulaties identificeren die dialect-specifieke kenmerken coderen, en aantonen dat het versterken of onderdrukken van deze neuronen de modeloutput in de richting van doeldialecten kan sturen. Ten tweede, gemotiveerd door de verstrengeling van dialectische kenmerken op het niveau van individuele neuronen, passen we een vectorsturingsaanpak toe die dialect-specifieke activatierichtingen extraheert en deze tijdens de inferentie injecteert. Samen belichten deze methoden de geometrie van dialectische kennis in Arabische LLM’s en bieden ze een principieel, op interpreteerbaarheid gebaseerd raamwerk voor dialectcontrole zonder dat er dialect-specifieke fijnafstemming nodig is.
English
A key challenge in Arabic NLP is the scarcity of dialectal data relative to Modern Standard Arabic (MSA), causing LLMs to overproduce MSA and struggle with dialectally accurate generation. From an interpretability perspective, this raises a fundamental question: where and how are dialectal features encoded within model internals, and can these representations be leveraged to improve dialect generation without fine-tuning? This study investigates two complementary inference-time approaches that serve simultaneously as interpretability probes and control mechanisms. First, we conduct a neuron-level analysis, identifying sparse neuron populations that encode dialect-specific features and showing that amplifying or suppressing these neurons can steer model outputs toward target dialects. Second, motivated by the entanglement of dialectal features at the single-neuron level, we apply a vector-steering approach that extracts dialect-specific activation directions and injects them during inference. Together, these methods illuminate the geometry of dialectal knowledge in Arabic LLMs and offer a principled, interpretability-grounded framework for dialect control without requiring dialect-specific fine-tuning.