Можно ли управлять диалектами так же, как языками? Разреженные нейроны и распределенные направления в арабских LLM
Can Dialects Be Steered Like Languages? Sparse Neurons and Distributed Directions in Arabic LLMs
July 4, 2026
Авторы: Kareem Elozeiri, Mervat Abassy, Omar Kallas, Fahim Dalvi, Preslav Nakov, Kentaro Inui, Nadir Durrani
cs.AI
Аннотация
Ключевая проблема в обработке арабского языка (NLP) заключается в нехватке данных на диалектах по сравнению с современным стандартным арабским языком (MSA), что приводит к чрезмерной генерации MSA большими языковыми моделями (LLM) и их затруднениям при точном порождении диалектных текстов. С точки зрения интерпретируемости это ставит фундаментальный вопрос: где и как диалектные признаки кодируются во внутренних представлениях модели, и можно ли использовать эти репрезентации для улучшения генерации диалектов без дообучения? В данном исследовании рассматриваются два взаимодополняющих подхода на этапе инференса, которые одновременно служат как средствами интерпретируемости, так и механизмами управления. Во-первых, мы проводим анализ на уровне нейронов, выявляя разреженные популяции нейронов, кодирующие диалектно-специфические признаки, и показывая, что усиление или подавление этих нейронов может направлять выходные данные модели в сторону целевых диалектов. Во-вторых, мотивированные запутанностью диалектных признаков на уровне отдельных нейронов, мы применяем подход векторного управления, который извлекает диалектно-специфические направления активации и внедряет их во время инференса. В совокупности эти методы освещают геометрию диалектных знаний в арабских LLM и предлагают принципиальный, основанный на интерпретируемости фреймворк для контроля над диалектами, не требующий диалектно-специфического дообучения.
English
A key challenge in Arabic NLP is the scarcity of dialectal data relative to Modern Standard Arabic (MSA), causing LLMs to overproduce MSA and struggle with dialectally accurate generation. From an interpretability perspective, this raises a fundamental question: where and how are dialectal features encoded within model internals, and can these representations be leveraged to improve dialect generation without fine-tuning? This study investigates two complementary inference-time approaches that serve simultaneously as interpretability probes and control mechanisms. First, we conduct a neuron-level analysis, identifying sparse neuron populations that encode dialect-specific features and showing that amplifying or suppressing these neurons can steer model outputs toward target dialects. Second, motivated by the entanglement of dialectal features at the single-neuron level, we apply a vector-steering approach that extracts dialect-specific activation directions and injects them during inference. Together, these methods illuminate the geometry of dialectal knowledge in Arabic LLMs and offer a principled, interpretability-grounded framework for dialect control without requiring dialect-specific fine-tuning.