O Sistema Tatoxa para Detoxificação de Texto em Línguas de Baixos Recursos: O Caso do Tártaro
The Tatoxa System for Text Detoxification in Low-Resource Languages: The Case of Tatar
June 24, 2026
Autores: Ilseyar Alimova, Bogdan Monogov, Artyom Mazur, Daniil Antonov, Vsevolod Karimov, Vitaliy Egorov, Bulat Khakimov, Alexander Panchenko
cs.AI
Resumo
A detoxificação de texto, ou seja, a detecção e mitigação automatizadas de conteúdo abusivo e prejudicial, é essencial para garantir a segurança das comunidades online e proteger os usuários. No entanto, línguas de baixos recursos, como o tártaro, têm recebido pouca atenção em pesquisas. Neste artigo, apresentamos o Tatoxa, um novo sistema de estado da arte para detoxificação de texto na língua tártara. Experimentos comparativos demonstram que a abordagem proposta supera os LLMs comerciais proprietários e de código aberto existentes em métricas-chave de qualidade. Também introduzimos um novo conjunto de dados para detoxificação de texto em tártaro, projetado para ajuste fino e avaliação em cenários de baixos recursos. Por fim, experimentos de transferência interlinguística indicam que a transferência a partir de outras línguas, incluindo o russo, que é culturalmente próximo, apresenta desempenho significativamente inferior ao treinamento com dados nativos do tártaro, mesmo quando um grande corpus em russo está disponível.
English
Text detoxification, the automated detection and mitigation of abusive and harmful content, is essential for ensuring the safety of online communities and protecting users. However, low resource languages such as Tatar have received little research attention. In this paper we present Tatoxa, a novel state-of-the-art system for text detoxification in the Tatar language. Comparative experiments show that the proposed approach outperforms existing open source and proprietary commercial LLMs on key quality metrics. We also introduce a new dataset for text detoxification in Tatar, designed for fine tuning and evaluation in low resource settings. Finally, cross lingual transfer experiments indicate that transfer from other languages, including the culturally close Russian, performs significantly worse than training on native Tatar data even when a large Russian corpus is available.