Het Tatoxa-systeem voor tekstdetoxificatie in laag-resourcetalen: de casus van het Tataars
The Tatoxa System for Text Detoxification in Low-Resource Languages: The Case of Tatar
June 24, 2026
Auteurs: Ilseyar Alimova, Bogdan Monogov, Artyom Mazur, Daniil Antonov, Vsevolod Karimov, Vitaliy Egorov, Bulat Khakimov, Alexander Panchenko
cs.AI
Samenvatting
Tekstdetoxificatie, de geautomatiseerde detectie en mitigatie van beledigende en schadelijke inhoud, is essentieel voor het waarborgen van de veiligheid van online gemeenschappen en het beschermen van gebruikers. Echter, talen met weinig bronnen zoals het Tataars hebben weinig onderzoeksaandacht gekregen. In dit artikel presenteren we Tatoxa, een nieuw state-of-the-art systeem voor tekstdetoxificatie in de Tataarse taal. Vergelijkende experimenten tonen aan dat de voorgestelde aanpak bestaande open source en propriëtaire commerciële LLM's overtreft op belangrijke kwaliteitsmetrics. We introduceren ook een nieuwe dataset voor tekstdetoxificatie in het Tataars, ontworpen voor fine-tuning en evaluatie in omgevingen met weinig bronnen. Ten slotte geven cross-linguale transferexperimenten aan dat transfer vanuit andere talen, waaronder het cultureel verwante Russisch, significant slechter presteert dan trainen op inheemse Tataarse data, zelfs wanneer een groot Russisch corpus beschikbaar is.
English
Text detoxification, the automated detection and mitigation of abusive and harmful content, is essential for ensuring the safety of online communities and protecting users. However, low resource languages such as Tatar have received little research attention. In this paper we present Tatoxa, a novel state-of-the-art system for text detoxification in the Tatar language. Comparative experiments show that the proposed approach outperforms existing open source and proprietary commercial LLMs on key quality metrics. We also introduce a new dataset for text detoxification in Tatar, designed for fine tuning and evaluation in low resource settings. Finally, cross lingual transfer experiments indicate that transfer from other languages, including the culturally close Russian, performs significantly worse than training on native Tatar data even when a large Russian corpus is available.