ChatPaper.aiChatPaper

100 000+ critiques de films du Kazakhstan : textes en russe, kazakh et en alternance codique

100,000+ Movie Reviews from Kazakhstan: Russian, Kazakh, and Code-Switched Texts

May 9, 2026
Auteurs: Rustem Yeshpanov
cs.AI

Résumé

Nous présentons un nouveau corpus public de 100 502 critiques de films du Kazakhstan collectées sur kino.kz, couvrant la période 2001-2025 et incluant 4 943 titres uniques. Le jeu de données est multilingue, composé principalement de critiques en russe ainsi que de textes en kazakh et mélangeant les codes linguistiques. Les critiques sont annotées manuellement pour la langue et la polarité des sentiments, et 11 309 critiques contiennent également des évaluations explicites fournies par les utilisateurs. Nous définissons deux tâches d'analyse des sentiments — une classification de polarité à trois niveaux et une classification des scores en cinq classes — et comparons des modèles de base utilisant des approches classiques (sac de mots/TF-IDF) avec des modèles transformateurs multilingues (mBERT, XLM-RoBERTa, RemBERT). Les résultats expérimentaux montrent que les modèles transformateurs surpassent systématiquement les approches classiques pour la classification de polarité, tandis que la classification des scores reste difficile dans une évaluation contrôlée contre les fuites de données, en raison d'un déséquilibre marqué entre les classes et de distinctions subtiles entre les niveaux d'évaluation adjacents.
English
We present a new publicly available corpus of 100,502 movie reviews from Kazakhstan collected from kino.kz, spanning 2001-2025 and covering 4,943 unique titles. The dataset is multilingual, consisting mainly of Russian reviews alongside Kazakh and code-switched texts. Reviews are manually annotated for language and sentiment polarity, and 11,309 reviews additionally contain explicit user-provided ratings. We define two sentiment tasks -- three-way polarity classification and five-class score classification -- and benchmark classical BoW/TF-IDF baselines against multilingual transformer models (mBERT, XLM-RoBERTa, RemBERT). Experimental results show that transformer models consistently outperform classical baselines on polarity classification, while score classification remains challenging under leakage-controlled evaluation due to severe class imbalance and subtle distinctions between adjacent rating levels.