ChatPaper.aiChatPaper

Mais de 100.000 críticas de filmes do Cazaquistão: textos em russo, cazaque e com alternância de código

100,000+ Movie Reviews from Kazakhstan: Russian, Kazakh, and Code-Switched Texts

May 9, 2026
Autores: Rustem Yeshpanov
cs.AI

Resumo

Apresentamos um novo corpus disponível publicamente de 100.502 críticas de filmes do Cazaquistão, coletadas do kino.kz, abrangendo o período de 2001 a 2025 e cobrindo 4.943 títulos distintos. O conjunto de dados é multilíngue, composto principalmente por críticas em russo, juntamente com textos em cazaque e com alternância de código. As críticas são anotadas manualmente quanto ao idioma e à polaridade de sentimento, e 11.309 críticas contêm adicionalmente classificações explícitas fornecidas pelos usuários. Definimos duas tarefas de sentimento — classificação ternária de polaridade e classificação de pontuação em cinco classes — e comparamos linhas de base clássicas BoW/TF-IDF com modelos transformer multilíngues (mBERT, XLM-RoBERTa, RemBERT). Os resultados experimentais mostram que os modelos transformer superam consistentemente as linhas de base clássicas na classificação de polaridade, enquanto a classificação de pontuação permanece desafiadora sob avaliação controlada por vazamento, devido ao grave desequilíbrio de classes e às distinções sutis entre níveis de classificação adjacentes.
English
We present a new publicly available corpus of 100,502 movie reviews from Kazakhstan collected from kino.kz, spanning 2001-2025 and covering 4,943 unique titles. The dataset is multilingual, consisting mainly of Russian reviews alongside Kazakh and code-switched texts. Reviews are manually annotated for language and sentiment polarity, and 11,309 reviews additionally contain explicit user-provided ratings. We define two sentiment tasks -- three-way polarity classification and five-class score classification -- and benchmark classical BoW/TF-IDF baselines against multilingual transformer models (mBERT, XLM-RoBERTa, RemBERT). Experimental results show that transformer models consistently outperform classical baselines on polarity classification, while score classification remains challenging under leakage-controlled evaluation due to severe class imbalance and subtle distinctions between adjacent rating levels.