ChatPaper.aiChatPaper

Dialetos Podem Ser Guiados Como Línguas? Neurônios Esparsos e Direções Distribuídas em LLMs Árabes

Can Dialects Be Steered Like Languages? Sparse Neurons and Distributed Directions in Arabic LLMs

July 4, 2026
Autores: Kareem Elozeiri, Mervat Abassy, Omar Kallas, Fahim Dalvi, Preslav Nakov, Kentaro Inui, Nadir Durrani
cs.AI

Resumo

Um desafio fundamental no PLN árabe é a escassez de dados dialetais em relação ao Árabe Padrão Moderno (APM), fazendo com que os LLMs superproduzam APM e tenham dificuldade com a geração dialetal precisa. Do ponto de vista da interpretabilidade, isso levanta uma questão fundamental: onde e como as características dialetais são codificadas no interior do modelo, e essas representações podem ser aproveitadas para melhorar a geração dialetal sem ajuste fino? Este estudo investiga duas abordagens complementares em tempo de inferência que servem simultaneamente como sondas de interpretabilidade e mecanismos de controle. Primeiro, realizamos uma análise em nível de neurônios, identificando populações esparsas de neurônios que codificam características dialetais específicas e mostrando que amplificar ou suprimir esses neurônios pode direcionar as saídas do modelo para dialetos alvo. Segundo, motivados pelo entrelaçamento das características dialetais no nível de neurônios individuais, aplicamos uma abordagem de direcionamento vetorial que extrai direções de ativação específicas do dialeto e as injeta durante a inferência. Juntos, esses métodos iluminam a geometria do conhecimento dialetal em LLMs árabes e oferecem um arcabouço fundamentado em princípios e baseado em interpretabilidade para controle de dialeto sem exigir ajuste fino específico do dialeto.
English
A key challenge in Arabic NLP is the scarcity of dialectal data relative to Modern Standard Arabic (MSA), causing LLMs to overproduce MSA and struggle with dialectally accurate generation. From an interpretability perspective, this raises a fundamental question: where and how are dialectal features encoded within model internals, and can these representations be leveraged to improve dialect generation without fine-tuning? This study investigates two complementary inference-time approaches that serve simultaneously as interpretability probes and control mechanisms. First, we conduct a neuron-level analysis, identifying sparse neuron populations that encode dialect-specific features and showing that amplifying or suppressing these neurons can steer model outputs toward target dialects. Second, motivated by the entanglement of dialectal features at the single-neuron level, we apply a vector-steering approach that extracts dialect-specific activation directions and injects them during inference. Together, these methods illuminate the geometry of dialectal knowledge in Arabic LLMs and offer a principled, interpretability-grounded framework for dialect control without requiring dialect-specific fine-tuning.