ChatPaper.aiChatPaper

Les dialectes peuvent-ils être orientés comme les langues ? Neurones épars et directions distribuées dans les LLMs arabes

Can Dialects Be Steered Like Languages? Sparse Neurons and Distributed Directions in Arabic LLMs

July 4, 2026
Auteurs: Kareem Elozeiri, Mervat Abassy, Omar Kallas, Fahim Dalvi, Preslav Nakov, Kentaro Inui, Nadir Durrani
cs.AI

Résumé

Un défi majeur en TAL arabe est la rareté des données dialectales par rapport à l’arabe standard moderne (MSA), ce qui pousse les LLM à surproduire du MSA et à éprouver des difficultés à générer avec précision dans les dialectes. D’un point de vue de l’interprétabilité, cela soulève une question fondamentale : où et comment les caractéristiques dialectales sont-elles encodées dans les internes du modèle, et peut-on exploiter ces représentations pour améliorer la génération dialectale sans ajustement fin ? Cette étude examine deux approches complémentaires en temps d’inférence qui servent à la fois de sondes d’interprétabilité et de mécanismes de contrôle. Premièrement, nous menons une analyse au niveau des neurones, identifiant des populations de neurones parcimonieuses qui encodent des caractéristiques spécifiques aux dialectes, et montrant que l’amplification ou la suppression de ces neurones peut orienter les sorties du modèle vers les dialectes cibles. Deuxièmement, motivés par l’enchevêtrement des caractéristiques dialectales au niveau du neurone unique, nous appliquons une approche de pilotage vectoriel qui extrait des directions d’activation spécifiques aux dialectes et les injecte lors de l’inférence. Ensemble, ces méthodes éclairent la géométrie des connaissances dialectales dans les LLM arabes et offrent un cadre fondé sur des principes et ancré dans l’interprétabilité pour le contrôle des dialectes, sans nécessiter d’ajustement fin spécifique aux dialectes.
English
A key challenge in Arabic NLP is the scarcity of dialectal data relative to Modern Standard Arabic (MSA), causing LLMs to overproduce MSA and struggle with dialectally accurate generation. From an interpretability perspective, this raises a fundamental question: where and how are dialectal features encoded within model internals, and can these representations be leveraged to improve dialect generation without fine-tuning? This study investigates two complementary inference-time approaches that serve simultaneously as interpretability probes and control mechanisms. First, we conduct a neuron-level analysis, identifying sparse neuron populations that encode dialect-specific features and showing that amplifying or suppressing these neurons can steer model outputs toward target dialects. Second, motivated by the entanglement of dialectal features at the single-neuron level, we apply a vector-steering approach that extracts dialect-specific activation directions and injects them during inference. Together, these methods illuminate the geometry of dialectal knowledge in Arabic LLMs and offer a principled, interpretability-grounded framework for dialect control without requiring dialect-specific fine-tuning.