¿Pueden los dialectos ser dirigidos como los idiomas? Neuronas dispersas y direcciones distribuidas en LLMs árabes
Can Dialects Be Steered Like Languages? Sparse Neurons and Distributed Directions in Arabic LLMs
July 4, 2026
Autores: Kareem Elozeiri, Mervat Abassy, Omar Kallas, Fahim Dalvi, Preslav Nakov, Kentaro Inui, Nadir Durrani
cs.AI
Resumen
Un desafío clave en el Procesamiento del Lenguaje Natural (PLN) del árabe es la escasez de datos dialectales en comparación con el Árabe Estándar Moderno (AEM), lo que provoca que los modelos de lenguaje de gran escala (LLMs) sobregeneren AEM y tengan dificultades para generar contenido dialectalmente preciso. Desde una perspectiva de interpretabilidad, esto plantea una cuestión fundamental: ¿dónde y cómo se codifican los rasgos dialectales dentro de las representaciones internas del modelo, y pueden estas representaciones aprovecharse para mejorar la generación de dialectos sin necesidad de ajuste fino? Este estudio investiga dos enfoques complementarios en tiempo de inferencia que funcionan simultáneamente como sondas de interpretabilidad y mecanismos de control. En primer lugar, realizamos un análisis a nivel de neuronas, identificando poblaciones neuronales dispersas que codifican rasgos específicos de cada dialecto y demostrando que amplificar o suprimir estas neuronas puede orientar las salidas del modelo hacia los dialectos objetivo. En segundo lugar, motivados por el entrelazamiento de los rasgos dialectales a nivel de neuronas individuales, aplicamos un enfoque de dirección vectorial que extrae direcciones de activación específicas de cada dialecto y las inyecta durante la inferencia. En conjunto, estos métodos iluminan la geometría del conocimiento dialectal en los LLMs de árabe y ofrecen un marco fundamentado en la interpretabilidad y basado en principios para el control de dialectos sin necesidad de ajuste fino específico para cada dialecto.
English
A key challenge in Arabic NLP is the scarcity of dialectal data relative to Modern Standard Arabic (MSA), causing LLMs to overproduce MSA and struggle with dialectally accurate generation. From an interpretability perspective, this raises a fundamental question: where and how are dialectal features encoded within model internals, and can these representations be leveraged to improve dialect generation without fine-tuning? This study investigates two complementary inference-time approaches that serve simultaneously as interpretability probes and control mechanisms. First, we conduct a neuron-level analysis, identifying sparse neuron populations that encode dialect-specific features and showing that amplifying or suppressing these neurons can steer model outputs toward target dialects. Second, motivated by the entanglement of dialectal features at the single-neuron level, we apply a vector-steering approach that extracts dialect-specific activation directions and injects them during inference. Together, these methods illuminate the geometry of dialectal knowledge in Arabic LLMs and offer a principled, interpretability-grounded framework for dialect control without requiring dialect-specific fine-tuning.